모델이 다른 픽이 더 나았다고 할 때, 그중 얼마나 실제로 나타날까?
2026년 10월 5일 게시 · 랭크 게임 12,000판의 밴픽 상태 90,408개
“가렌이 3.9포인트 더 나았다”고 말하는 밴픽 도구는 검증할 수 있는 주장을 하는 셈입니다. 실제 밴픽 상태 90,408개에서 모델이 더 높게 평가한 픽은 실제로 더 많이 이겼습니다. 챔피언만 알 때는 제시한 차이의 0.82, 픽하는 플레이어를 알 때는 0.83만큼입니다. KayLoL은 모든 비용을 그 비율과 불확실성과 함께 표시하며 이를 보정이라고 부릅니다. 챔피언을 바꿨다면 게임 결과가 달라졌을 것이라는 증거는 아닙니다.
측정 방법
결과가 있는 것은 실제로 한 픽뿐이므로 “X를 골랐다면”은 관측되지 않습니다. 검증할 수 있는 것은, 서로 다른 플레이어가 서로 다른 픽을 한 수많은 상태에 걸쳐 모델이 말하는 픽 사이의 차이가 결과에 나타나는지입니다.
- 실제 밴픽 상태마다, 그 이전 게임만으로 학습한 모델이 가능한 모든 후보를 평가합니다. 후보들의 평균이 보드의 값이고, 픽 자체의 값은 그 픽의 점수에서 평균을 뺀 값입니다.
- 게임 결과를 보드의 값과 픽 자체의 값에 회귀합니다. 두 번째 계수가 비율입니다. 1이면 모델이 말하는 픽 사이의 차이가 전부 나타난 것이고, 0이면 아무것도 담고 있지 않은 것입니다.
- 모든 게임은 그것을 평가한 모델이 만들어진 뒤에 플레이되었고, 사용한 플레이어 기록은 그날이 시작되기 전에 고정했습니다.
- 한 게임의 상태들은 하나의 결과를 공유하므로 오차는 게임 단위로 묶었습니다.
세 집단에서의 비율
챔피언만 기준 수치는 같은 모델을 서로 다른 날에 두 번 측정해 합친 값입니다. 첫 번째 측정만으로는 0.675 ± 0.118, 두 번째는 0.969 ± 0.118였습니다. 둘의 차이는 합친 오차의 두 배보다 작으므로, 어느 한쪽만으로는 그 수치라고 할 수 없습니다.
| 집단 | 밴픽 상태 수 | 비율 | 95% 범위 |
|---|---|---|---|
| 챔피언만 | 90,408 | 0.82 ± 0.08 | 0.66–0.98 |
| 픽하는 플레이어를 알 때, 모든 후보 | 13,312 | 0.83 ± 0.15 | 0.55–1.12 |
| 픽하는 플레이어를 알 때, 그 플레이어가 이미 쓰는 챔피언만 | 50,597 | 0.56 ± 0.07 | 0.42–0.70 |
2026년 10월 5일까지 사이트는 플레이어를 아는 해석에 0.29를 썼습니다. 그 수치는 마지막 행인 플레이어 자신의 챔피언 풀에서 나온 것인데, 모든 후보에 적용되고 있었습니다. 실제로 적용되는 집단에서 측정하면 비율은 0.83입니다.
하나의 직선일까?
작은 차이는 잡음이고 큰 차이만 진짜라면 하나의 비율은 오해를 부릅니다. 챔피언만 기준 상태를 픽의 제시값에 따라 같은 크기의 열 그룹으로 나누면, 관측값은 전 구간에서 제시값을 따라가며 곡률 항은 0과 구별되지 않습니다.
| 제시값 (포인트) | 밴픽 상태 수 | 관측값 (포인트) | 95% 범위 |
|---|---|---|---|
| −3.16 | 4,516 | −2.96 | −4.42 – −1.67 |
| −1.43 | 4,515 | −2.14 | −3.42 – −0.78 |
| −0.71 | 4,515 | −1.18 | −2.75 – +0.13 |
| −0.18 | 4,516 | −0.49 | −1.85 – +0.84 |
| +0.26 | 4,515 | −1.72 | −3.26 – −0.27 |
| +0.67 | 4,515 | +0.55 | −0.73 – +1.87 |
| +1.09 | 4,516 | +0.63 | −0.70 – +2.03 |
| +1.58 | 4,527 | +1.32 | 0.00 – +2.74 |
| +2.25 | 4,503 | +2.81 | +1.54 – +4.23 |
| +3.89 | 4,516 | +3.20 | +1.85 – +4.43 |
범위는 넓습니다. 각 그룹의 결과는 1포인트 넘게 불확실합니다. 이 그림은 원점을 지나는 직선을 뒷받침할 뿐, 특정한 휘어짐을 뒷받침하지는 않습니다.
비율을 적용하면 예측이 나아질까?
같은 상태에서 승자를 예측하는 세 가지 방법입니다. 보드만, 보드에 실제 픽에 대한 모델의 전체 차이를 더한 것, 보드에 사이트가 쓰던 비율만큼의 차이를 더한 것. 픽을 아는 예측은 AUC, 로그 손실, 브라이어 점수에서 보드만 쓴 예측을 앞섭니다. 이 게임들에서는 차이를 줄여도 전체 차이를 쓴 예측을 앞서지 못했습니다.
| 예측 | AUC | 로그 손실 | 브라이어 | 정확도 | ECE |
|---|---|---|---|---|---|
| 보드만 | 0.5391 | 0.6903 | 0.2486 | 52.64% | 0.0074 |
| 보드 + 모델의 전체 차이 | 0.5445 | 0.6895 | 0.2482 | 53.08% | 0.0062 |
| 보드 + 이전 비율(0.675)의 차이 | 0.5440 | 0.6896 | 0.2482 | 53.12% | 0.0055 |
사이트에서 달라지는 점
아레나 리포트와 게임 리뷰는 비용을 관측 결과로 표시합니다. 모델의 차이에 비율을 곱한 값이며, 비율 자체의 불확실성에서 나온 95% 범위가 함께 붙습니다. 그 범위의 하한이 여전히 0.5포인트를 넘을 때만 대안을 더 나았을 가능성이 높다고 부릅니다.
순위, 등급, 레이팅은 픽의 순서를 읽으며, 공통 비율은 그 순서를 바꿀 수 없습니다. 밴픽 아레나와 게임 리뷰가 같은 수치를 씁니다.
이 연구가 보여 주지 않는 것
- 관찰 연구입니다. 플레이어는 모델이 일부만 볼 수 있는 이유로 챔피언을 고르므로, 1에 가까운 비율은 조언이 옳기 위한 필요조건일 뿐 다른 픽이 이겼을 것이라는 증거가 아닙니다.
- 나흘, 한 지역, 한 모델입니다. 사이트는 현재 세 지역으로 학습한 더 나중의 모델을 쓰며, 그 모델은 이 방식으로 측정하지 않았습니다.
- 데이터에는 관측된 픽 순서가 없어, 각 진영의 순서는 학습 때와 같은 방식으로 배정했습니다.
- 플레이어를 아는 수치는 픽하는 플레이어만 압니다. 리뷰의 “모두 공개” 해석은 열 명을 모두 압니다.
- 플레이어 자신의 챔피언 풀 안에서는 보드보다 약 2포인트까지 높게 평가된 픽이 거의 아무 효과도 보이지 않았고, 효과는 양 끝에 있었습니다.
다음에는 무엇을 측정할까요? 연구 페이지에서 질문하기. 데이터로 답할 수 있는 질문 중 가장 많은 표를 받은 것이 다음 연구가 됩니다.