← Investigación

Cuando el modelo dice que otra elección era mejor, ¿cuánto de eso se ve?

Cómo se midió

Solo la elección que se hizo tiene resultado, así que «qué habría pasado con X» nunca se observa. Lo que sí se puede probar es si las diferencias del modelo entre elecciones aparecen a lo largo de muchos estados en los que distintos jugadores eligieron distinto.

La proporción, en tres poblaciones

La cifra de solo campeones es la combinación de dos mediciones del mismo modelo en días distintos. La primera, por sí sola, dio 0,675 ± 0,118; la segunda, 0,969 ± 0,118. Difieren en menos del doble de su error combinado, así que ninguna de las dos por separado es la cifra.

PoblaciónEstados de draftProporciónRango del 95 %
Solo campeones90.4080,82 ± 0,080,66–0,98
Jugador que elige conocido, todos los candidatos13.3120,83 ± 0,150,55–1,12
Jugador que elige conocido, solo campeones que ya juega50.5970,56 ± 0,070,42–0,70

Hasta el 5 de octubre de 2026 el sitio usaba 0,29 para la lectura con jugador conocido. Esa cifra venía del repertorio propio del jugador, la última fila, y se aplicaba a todos los candidatos. Medida donde se aplica, la proporción es 0,83.

¿Es una sola recta?

Si las diferencias pequeñas fueran ruido y solo las grandes fueran reales, una única proporción engañaría. Al ordenar los estados de solo campeones en diez grupos iguales según el valor prometido de la elección, lo observado sigue a lo prometido en todo el rango, y un término de curvatura no se distingue de cero.

Diez grupos de estados de draftLa proporción combinada, 0,82
−4−20+2+4−4−20+2+4Valor de la elección según el modelo, frente al tablero (puntos)
Eje vertical: lo observado, en puntos. Cada punto son unos 4.500 estados de draft de las partidas del 2–3 de octubre; los bigotes son rangos del 95 % remuestreados por partida. La línea discontinua es lo prometido por completo; la continua, la proporción combinada.
Prometido (puntos)Estados de draftObservado (puntos)Rango del 95 %
−3,164516−2,96−4,42 – −1,67
−1,434515−2,14−3,42 – −0,78
−0,714515−1,18−2,75 – +0,13
−0,184516−0,49−1,85 – +0,84
+0,264515−1,72−3,26 – −0,27
+0,674515+0,55−0,73 – +1,87
+1,094516+0,63−0,70 – +2,03
+1,584527+1,320,00 – +2,74
+2,254503+2,81+1,54 – +4,23
+3,894516+3,20+1,85 – +4,43

Los rangos son anchos: el resultado de cada grupo tiene una incertidumbre de más de un punto. La imagen respalda una recta que pasa por cero, no una curva concreta.

¿Mejora el pronóstico al escalar?

Sobre los mismos estados, tres pronósticos de quién gana: el tablero solo, el tablero más la diferencia completa del modelo para la elección hecha, y el tablero más la diferencia en la proporción que usaba el sitio. Conocer la elección supera al tablero solo en AUC, log loss y Brier. Reducir la diferencia no superó a la diferencia completa en estas partidas.

PronósticoAUCLog lossBrierAciertoECE
Tablero solo0,53910,69030,248652,64 %0,0074
Tablero + la diferencia completa del modelo0,54450,68950,248253,08 %0,0062
Tablero + la diferencia en la proporción anterior (0,675)0,54400,68960,248253,12 %0,0055

Qué cambia esto en el sitio

Los informes de la arena y las revisiones de partida muestran un coste en resultados observados: la diferencia del modelo por la proporción, con un rango del 95 % que viene de la incertidumbre de la propia proporción. Una alternativa solo se llama probablemente mejor cuando el extremo bajo de ese rango sigue por encima de medio punto.

Las clasificaciones, las notas y las puntuaciones leen el orden de las elecciones, que una proporción común no puede cambiar. La arena de draft y la revisión de partida usan las mismas cifras.

Lo que no demuestra

¿Qué deberíamos medir después? Pregunta en la página de investigación. Las preguntas más votadas que nuestros datos puedan responder serán futuros estudios.