← 연구

모델이 다른 픽이 더 나았다고 할 때, 그중 얼마나 실제로 나타날까?

측정 방법

결과가 있는 것은 실제로 한 픽뿐이므로 “X를 골랐다면”은 관측되지 않습니다. 검증할 수 있는 것은, 서로 다른 플레이어가 서로 다른 픽을 한 수많은 상태에 걸쳐 모델이 말하는 픽 사이의 차이가 결과에 나타나는지입니다.

세 집단에서의 비율

챔피언만 기준 수치는 같은 모델을 서로 다른 날에 두 번 측정해 합친 값입니다. 첫 번째 측정만으로는 0.675 ± 0.118, 두 번째는 0.969 ± 0.118였습니다. 둘의 차이는 합친 오차의 두 배보다 작으므로, 어느 한쪽만으로는 그 수치라고 할 수 없습니다.

집단밴픽 상태 수비율95% 범위
챔피언만90,4080.82 ± 0.080.66–0.98
픽하는 플레이어를 알 때, 모든 후보13,3120.83 ± 0.150.55–1.12
픽하는 플레이어를 알 때, 그 플레이어가 이미 쓰는 챔피언만50,5970.56 ± 0.070.42–0.70

2026년 10월 5일까지 사이트는 플레이어를 아는 해석에 0.29를 썼습니다. 그 수치는 마지막 행인 플레이어 자신의 챔피언 풀에서 나온 것인데, 모든 후보에 적용되고 있었습니다. 실제로 적용되는 집단에서 측정하면 비율은 0.83입니다.

하나의 직선일까?

작은 차이는 잡음이고 큰 차이만 진짜라면 하나의 비율은 오해를 부릅니다. 챔피언만 기준 상태를 픽의 제시값에 따라 같은 크기의 열 그룹으로 나누면, 관측값은 전 구간에서 제시값을 따라가며 곡률 항은 0과 구별되지 않습니다.

밴픽 상태 열 그룹합친 비율 0.82
−4−20+2+4−4−20+2+4보드 대비 모델이 제시한 픽의 값 (포인트)
세로축: 관측값(포인트). 각 점은 10월 2–3일 게임의 밴픽 상태 약 4,500개이며, 수염은 게임 단위로 재표집한 95% 범위입니다. 점선은 제시값이 전부 나타난 경우, 실선은 합친 비율입니다.
제시값 (포인트)밴픽 상태 수관측값 (포인트)95% 범위
−3.164,516−2.96−4.42 – −1.67
−1.434,515−2.14−3.42 – −0.78
−0.714,515−1.18−2.75 – +0.13
−0.184,516−0.49−1.85 – +0.84
+0.264,515−1.72−3.26 – −0.27
+0.674,515+0.55−0.73 – +1.87
+1.094,516+0.63−0.70 – +2.03
+1.584,527+1.320.00 – +2.74
+2.254,503+2.81+1.54 – +4.23
+3.894,516+3.20+1.85 – +4.43

범위는 넓습니다. 각 그룹의 결과는 1포인트 넘게 불확실합니다. 이 그림은 원점을 지나는 직선을 뒷받침할 뿐, 특정한 휘어짐을 뒷받침하지는 않습니다.

비율을 적용하면 예측이 나아질까?

같은 상태에서 승자를 예측하는 세 가지 방법입니다. 보드만, 보드에 실제 픽에 대한 모델의 전체 차이를 더한 것, 보드에 사이트가 쓰던 비율만큼의 차이를 더한 것. 픽을 아는 예측은 AUC, 로그 손실, 브라이어 점수에서 보드만 쓴 예측을 앞섭니다. 이 게임들에서는 차이를 줄여도 전체 차이를 쓴 예측을 앞서지 못했습니다.

예측AUC로그 손실브라이어정확도ECE
보드만0.53910.69030.248652.64%0.0074
보드 + 모델의 전체 차이0.54450.68950.248253.08%0.0062
보드 + 이전 비율(0.675)의 차이0.54400.68960.248253.12%0.0055

사이트에서 달라지는 점

아레나 리포트와 게임 리뷰는 비용을 관측 결과로 표시합니다. 모델의 차이에 비율을 곱한 값이며, 비율 자체의 불확실성에서 나온 95% 범위가 함께 붙습니다. 그 범위의 하한이 여전히 0.5포인트를 넘을 때만 대안을 더 나았을 가능성이 높다고 부릅니다.

순위, 등급, 레이팅은 픽의 순서를 읽으며, 공통 비율은 그 순서를 바꿀 수 없습니다. 밴픽 아레나와 게임 리뷰가 같은 수치를 씁니다.

이 연구가 보여 주지 않는 것

다음에는 무엇을 측정할까요? 연구 페이지에서 질문하기. 데이터로 답할 수 있는 질문 중 가장 많은 표를 받은 것이 다음 연구가 됩니다.