Cuando el modelo dice que otra elección era mejor, ¿cuánto de eso se ve?
Publicado el 5 de octubre de 2026 · 90.408 estados de draft de 12.000 partidas clasificatorias
Una herramienta de draft que dice «Garen era 3,9 puntos mejor» hace una afirmación que se puede comprobar. En 90.408 estados de draft reales, las elecciones que el modelo valoraba más sí ganaron más: en 0,82 de la diferencia prometida con solo los campeones conocidos, y en 0,83 con el jugador que elige conocido. KayLoL muestra cada coste en esa proporción, con su incertidumbre, y lo llama calibración: no demuestra que cambiar de campeón habría cambiado tu partida.
Cómo se midió
Solo la elección que se hizo tiene resultado, así que «qué habría pasado con X» nunca se observa. Lo que sí se puede probar es si las diferencias del modelo entre elecciones aparecen a lo largo de muchos estados en los que distintos jugadores eligieron distinto.
- Para cada estado de draft real, un modelo entrenado solo con partidas anteriores puntúa cada candidato legal. La media de los candidatos es el valor del tablero; el valor propio de la elección es su puntuación menos esa media.
- El resultado de la partida se ajusta sobre el valor del tablero y sobre el valor propio de la elección. El segundo coeficiente es la proporción: 1 significa que las diferencias del modelo se ven por completo, 0 que no aportan nada.
- Todas las partidas se jugaron después de construir el modelo que las puntuó, y los historiales de jugador usados se congelaron antes de empezar el día.
- Los errores se agrupan por partida, porque los estados de una partida comparten un resultado.
La proporción, en tres poblaciones
La cifra de solo campeones es la combinación de dos mediciones del mismo modelo en días distintos. La primera, por sí sola, dio 0,675 ± 0,118; la segunda, 0,969 ± 0,118. Difieren en menos del doble de su error combinado, así que ninguna de las dos por separado es la cifra.
| Población | Estados de draft | Proporción | Rango del 95 % |
|---|---|---|---|
| Solo campeones | 90.408 | 0,82 ± 0,08 | 0,66–0,98 |
| Jugador que elige conocido, todos los candidatos | 13.312 | 0,83 ± 0,15 | 0,55–1,12 |
| Jugador que elige conocido, solo campeones que ya juega | 50.597 | 0,56 ± 0,07 | 0,42–0,70 |
Hasta el 5 de octubre de 2026 el sitio usaba 0,29 para la lectura con jugador conocido. Esa cifra venía del repertorio propio del jugador, la última fila, y se aplicaba a todos los candidatos. Medida donde se aplica, la proporción es 0,83.
¿Es una sola recta?
Si las diferencias pequeñas fueran ruido y solo las grandes fueran reales, una única proporción engañaría. Al ordenar los estados de solo campeones en diez grupos iguales según el valor prometido de la elección, lo observado sigue a lo prometido en todo el rango, y un término de curvatura no se distingue de cero.
| Prometido (puntos) | Estados de draft | Observado (puntos) | Rango del 95 % |
|---|---|---|---|
| −3,16 | 4516 | −2,96 | −4,42 – −1,67 |
| −1,43 | 4515 | −2,14 | −3,42 – −0,78 |
| −0,71 | 4515 | −1,18 | −2,75 – +0,13 |
| −0,18 | 4516 | −0,49 | −1,85 – +0,84 |
| +0,26 | 4515 | −1,72 | −3,26 – −0,27 |
| +0,67 | 4515 | +0,55 | −0,73 – +1,87 |
| +1,09 | 4516 | +0,63 | −0,70 – +2,03 |
| +1,58 | 4527 | +1,32 | 0,00 – +2,74 |
| +2,25 | 4503 | +2,81 | +1,54 – +4,23 |
| +3,89 | 4516 | +3,20 | +1,85 – +4,43 |
Los rangos son anchos: el resultado de cada grupo tiene una incertidumbre de más de un punto. La imagen respalda una recta que pasa por cero, no una curva concreta.
¿Mejora el pronóstico al escalar?
Sobre los mismos estados, tres pronósticos de quién gana: el tablero solo, el tablero más la diferencia completa del modelo para la elección hecha, y el tablero más la diferencia en la proporción que usaba el sitio. Conocer la elección supera al tablero solo en AUC, log loss y Brier. Reducir la diferencia no superó a la diferencia completa en estas partidas.
| Pronóstico | AUC | Log loss | Brier | Acierto | ECE |
|---|---|---|---|---|---|
| Tablero solo | 0,5391 | 0,6903 | 0,2486 | 52,64 % | 0,0074 |
| Tablero + la diferencia completa del modelo | 0,5445 | 0,6895 | 0,2482 | 53,08 % | 0,0062 |
| Tablero + la diferencia en la proporción anterior (0,675) | 0,5440 | 0,6896 | 0,2482 | 53,12 % | 0,0055 |
Qué cambia esto en el sitio
Los informes de la arena y las revisiones de partida muestran un coste en resultados observados: la diferencia del modelo por la proporción, con un rango del 95 % que viene de la incertidumbre de la propia proporción. Una alternativa solo se llama probablemente mejor cuando el extremo bajo de ese rango sigue por encima de medio punto.
Las clasificaciones, las notas y las puntuaciones leen el orden de las elecciones, que una proporción común no puede cambiar. La arena de draft y la revisión de partida usan las mismas cifras.
Lo que no demuestra
- Es observacional. Los jugadores eligen campeón por razones que el modelo solo ve en parte, así que una proporción cercana a 1 es necesaria para que el consejo sea correcto, no una prueba de que otra elección habría ganado.
- Cuatro días, una región, un modelo. El sitio sirve ahora un modelo posterior entrenado con las tres regiones, que no se ha medido así.
- Los datos no tienen un orden de elección observado, así que el orden de cada lado se asigna como lo asigna el entrenamiento.
- La cifra con jugador conocido conoce solo al jugador que elige; la lectura «todos conocidos» de la revisión conoce a los diez.
- Dentro del repertorio propio de un jugador, las elecciones valoradas hasta unos dos puntos por encima del tablero casi no mostraron nada; el efecto estaba en los extremos.
¿Qué deberíamos medir después? Pregunta en la página de investigación. Las preguntas más votadas que nuestros datos puedan responder serán futuros estudios.