Підсумковий розбір найнижчого рівня: чому 46,8% перемог не свідчать про збій калібрування
Стисло — Наш найвужчий діапазон довіри (ймовірність перемоги 50,0%–55,0%, категорія «Very Low») завершив сезон із показником 46,83% (59 перемог – 67 поразок, n=126) проти відкаліброваного очікування на рівні 52,48%. Цей розрив у 6,4 відсоткового пункту на перший погляд скидався на повне руйнування калібрування. Проте це не так. Точний біноміальний критерій, декомпозиція оцінки Брієра за Мерфі, аналіз зсуву коваріат і повторне бутстреп-вибіркове оцінювання на 10 000 ітерацій одностайно зводяться до одного й того самого висновку: це відставання статистично не відрізняється від шуму, майже цілком зосереджене у 14-денному проміжку перед дедлайном обмінів і спричинене дефіцитом роздільної здатності (у моделі бракує сигналу для розрізнення, а не присутній хибний сигнал), а не дефектом надійності (некоректно відкалібровані ймовірності). Ми відмовилися від перекалібрування за методом Платта та переробки простору ознак. Натомість ми змінили правила експлуатації та класифікації категорій.
Загальні підсумки
Кожна модель у промисловій експлуатації рано чи пізно видає показник, який виглядає хибним. Питання ніколи не полягає в тому, чи «виглядає це дивно», — важить те, чи встоїть ця хибність перед перевіркою нульовою гіпотезою. У цьому дописі ми подаємо детальний аудит найслабшого діапазону довіри нашої моделі XGBoost_TOP17_v1.4_Platt за підсумками повного сезону прогнозів НБА в реальному часі. Також тут пояснено, чому після дев'яти етапів статистичної перевірки ми залишили саму модель без жодних змін.
Якщо коротко: вибірки n=126 замало, щоб винести вирок класифікатору, а специфіка отриманого відставання (двотижневе скупчення, близька до нуля роздільна здатність за Мерфі, цілковита відсутність кореляції з будь-якою із 17 вхідних ознак) свідчить про вибіркову дисперсію та ділянку ухвалення рішень із засадничо слабким сигналом, а не про зламану послідовність обробки даних.
Симптом
Логіка розподілу за рівнями в нашій робочій системі розбиває кожен прогноз за значенням winner_probability на чотири діапазони: Very Low (від 50,0% до 55,0%), Low, Medium та High. Діапазон Very Low за своєю структурою є вихідною межею моделі, що впритул межує з підкиданням монети — це матчі, де класифікатор бачить певну перевагу над простим розподілом 50/50, проте зовсім незначну.
Наприкінці сезону активна модель із калібруванням за Платтом (XGBoost_TOP17_v1.4_Platt, 742 гри) показала для рівня Very Low наступні результати:
| Метрика | Значення |
|---|---|
| Обсяг вибірки (n) | 126 ігор (16,98% загального обсягу моделі) |
| Баланс перемог і поразок | 59W – 67L |
| Фактична частка перемог | 46,83% |
| Середня прогнозована ймовірність (цільова) | 52,48% |
| Фактичне відхилення від цільової | −5,65 в. п. |
| Фактичне відхилення від середини (52,5%) | −5,67 в. п. |
Діапазон довіри з часткою успішних передбачень нижче за випадкову рівновагу — це показник, що викликає негайну спокусу діяти: наново підігнати параметри A та B Платта, перевірити зміщення вхідних ознак або запустити перенавчання. Перш ніж торкатися будь-чого з цього, ми провели отримане число через стандартну послідовність перевірки статистичної значущості.
Те, що окремий діапазон не дотягує до цільового значення — це доконаний факт. Але те, чи є цей факт доказом вади моделі — зовсім інше питання, яке чомусь ніхто не ставить перед тим, як відкрити черговий pull request.
Калібрування проти дисперсії
Спочатку — статистична потужність
Перед перевіркою значущості ми з'ясували, чи мав критерій достатню потужність для виявлення реального ефекту за такого обсягу вибірки. За n = 126 та alpha = 0,05 (однобічний критерій) потужність виявлення справжнього спаду з 52,5% до 46,8% становила лише 35,6% — тобто навіть якби зміщення існувало насправді, ми б не помітили його приблизно у двох третинах випадків. Досягнення загальноприйнятої потужності у 80% для розриву такого масштабу вимагало б n ≈ 479 розрахованих матчів — майже чотири повні сезони ігор рівня Very Low за нинішніх обсягів.
Це не доводить, що розрив є суто шумом. Проте це свідчить, що показники одного сезону в жодному разі не можна було вважати вирішальними в будь-який бік.
Точний біноміальний критерій і критерій відношення правдоподібності
Ми застосували точний двобічний біноміальний критерій, порівнявши фактичний результат (59W–67L) як із відкаліброваною ціллю моделі, так і з теоретичною рівновагою:
H₀: p = 0,5248 (відкалібрована ціль) p = 0,2125
H₀: p = 0,5000 (рівновага) p = 0,5331
Жоден із них не перетинає поріг alpha = 0,05. Ми додатково перевірили це за допомогою критерію відношення правдоподібності, порівнявши емпіричну оцінку максимальної вірогідності (p̂ = 0,4683) із відкаліброваною ціллю:
LLR = 2 · [ℓ(p̂) - ℓ(p₀)] = 1,6153, χ²(df=1), p = 0,2038
Той самий висновок: підстав для відхилення H0 немає. Точний 95% довірчий інтервал Клоппера-Пірсона для фактичного результату становить [37,88%, 55,92%] — діапазон завширшки 18 відсоткових пунктів, який цілком упевнено охоплює як цільові 52,48%, так і випадкову рівновагу 50,00%.
Узгодження чотирьох методів побудови інтервалів
Оскільки ширина інтервалу тут має більше значення, ніж будь-яка окрема точкова оцінка, ми не обмежилися одним підходом і перевірили фактичний результат 59/126 чотирма незалежними методами побудови 95% інтервалу, а також за допомогою непараметричного бутстрепу на 10 000 ітерацій:
| Метод | Тип | 95% Нижня | 95% Верхня | Ширина (в. п.) | Покриває 52,48%? |
|---|---|---|---|---|---|
| Емпіричний бутстреп (B = 10 000) | Непараметричний | 38,10% | 55,56% | 17,46 | ✅ |
| Оцінка Вілсона (Wilson Score) | Параметричний, без поправки | 38,34% | 55,50% | 17,17 | ✅ |
| Інтервал Клоппера-Пірсона | Точна біноміальна інверсія | 37,88% | 55,92% | 18,04 | ✅ |
| Вальд (нормальне наближення) | Асимптотичний нормальний | 38,11% | 55,54% | 17,43 | ✅ |
Усі чотири методи узгоджуються з точністю до 0,46 відсоткового пункту на обох межах — отже, отриманий інтервал не є артефактом конкретного наближення. Усі чотири покривають як відкалібрований орієнтир, так і рівновагу 50/50. На рівні довіри 99% довірчий інтервал бутстрепу розширюється до [35,71%, 57,94%], а емпіричний розподіл повторних вибірок показує, що 26,3% ітерацій опиняються на рівні або вище рівноваги, а 9,0% — на рівні або вище цільових 52,48%. Це звичайна подія з хвоста розподілу, а не аномальний викид.
Стандартна похибка емпіричного бутстрепу для цієї вибірки становить 4,44 відсоткового пункту. При цьому весь діапазон рівня Very Low має ширину лише 5,0 відсоткових пунктів. Одна-єдина стандартна похибка перекриває майже всю заплановану ширину цього рівня — що саме по собі дуже показово і до чого ми ще повернемося нижче, у розділі "Вжиті заходи щодо робочої моделі".
Аналіз сигналу: надійність проти роздільної здатності
Відсутність статистичної значущості вказує лише на те, що розрив міг бути шумом. Проте вона не пояснює, чому цей діапазон поводиться саме так. Щоб з'ясувати причину, ми звернулися до розкладу оцінки Брієра за Мерфі (1973):
Оцінка Брієра = Надійність (похибка калібрування)
− Роздільна здатність (дискримінаційна здатність)
+ Невизначеність (ентропія базової частоти)
Надійність показує, чи відповідають задекларовані ймовірності фактичним частотам (дефект калібрування). Роздільна здатність відображає, чи спроможна модель узагалі ранжувати наслідки подій у межах цього діапазону (дефект розрізнення). Це принципово різні механізми відмови, які вимагають протилежних дій: перший вимагає «підкоригувати сигмоїду», а другий вказує на те, що «більше сигналу звідси не вичавиш».
Конкретно для діапазону Very Low показники такі:
| Складова | Значення | Тлумачення |
|---|---|---|
| Оцінка Брієра | 0,2531 | Загальна похибка, підвищена відносно теоретичної стелі невизначеності |
| Надійність (похибка, ↓ краще) | 0,0067 | Незначна — ймовірності загалом правдиві |
| Роздільна здатність (сигнал, ↑ краще) | 0,0022 | Близька до нуля — здатність розрізняти майже відсутня |
| Невизначеність (макс. ентропія для цієї базової частоти) | 0,2490 | Теоретична межа для діапазону підкидання монети |
Цікаво, як модель виглядає за межами цього діапазону?
Сегмент "Very Low" — це лише один вузький зріз. Перегляньте повну криву калібрування для всього діапазону ймовірностей, які прогнозує модель.
Роздільна здатність становить лише близько 0,9% від стелі невизначеності. Для порівняння: на всьому обсязі робочої моделі (N = 742) роздільна здатність тримається на рівні 7,5% від невизначеності за додатного Brier Skill Score +0,0674. Усередині ж самого діапазону Very Low показник ROC AUC просідає до 0,4698 — що статистично не відрізняється від звичайного підкидання монети, порівняно із загальним рівнем 0,6684.
Модель не бреше про рівень своєї впевненості в цьому діапазоні. Вона каже правду: її знання тут майже не перевершують результат підкидання монети. Розклад Брієра підтверджує цю чесність — залишковий розрив майже цілком криється в дефіциті роздільної здатності, а не в порушенні надійності.
Ми також перевірили внутрішню однорідність — чи зосереджене відставання в певному локальному сегменті діапазону, чи воно рівномірно розподілене по всій довжині. Критерій хі-квадрат для трьох внутрішніх піддіапазонів ([0,500, 0,517) з результатом 50,0%, [0,517, 0,533) із 44,9% та [0,533, 0,550) із 46,1%) дав p = 0,8896: підінтервали статистично однорідні. Втім, поділ діапазону навпіл за відміткою 52,5% демонструє значно виразнішу картину: нижня половина ([50,0%, 52,5%), n = 62) досягла 51,61%, потрапивши точно в ціль, тоді як верхня половина ([52,5%, 55,0%), n = 64) показала лише 42,19%, увібравши практично весь дефіцит. Середній градієнт сигмоїди в межах усього діапазону, ∂P/∂z ≈ 0,2492, підтверджує, що в цій ділянці модель працює з максимальною чутливістю до збурень сирих оцінок — саме там, де мінімальний шум породжує найбільші коливання розрахункових ймовірностей.
Діагностика часових трендів і зсуву коваріат
Гостре осідання, а не хронічний дрейф
Аналіз сезону за допомогою 14-денного рухомого вікна одразу вказав на ділянку, де виник дефіцит. У період між 20 січня та 2 лютого 2026 року — проміжок перед дедлайном обмінів, коли ротація складів у НБА найбільш нестабільна, — категорія Very Low показала результат 5W–16L (23,81%) у 21 матчі, що утворило чисте відставання у −11 ігор лише за два тижні. Точний критерій Фішера для порівняння цього вікна з рештою 105 ігор сезону показав p = 0,0298 — дійсно значущу розбіжність.
Украй важливо, що це коливання не було локальним збоєм окремої категорії: контрольні рівні (від Low до High) у цей самий період зафіксували найнижчу точність за весь сезон (58,5%). Тобто йдеться про загальноринкову волатильність навколо дедлайну, а не про внутрішню ваду категорії Very Low.
Якщо цілком вилучити цей 14-денний проміжок, баланс категорії без урахування спаду становить 54W–51L (51,43%) у решті 105 ігор. Це значення лежить точно всередині запланованого діапазону [50,0%, 55,0%] і статистично не відрізняється від цільового орієнтира 52,48% (p = 0,8456).
Узгодження інтервалів простою мовою: кожен випробуваний нами підхід — точний біноміальний критерій, критерій Вілсона, Клоппера-Пірсона, Вальда, бутстреп на 10000 ітерацій — переконливо доводить, що дійсна частка перемог у цій категорії перебуває в межах розрахункового діапазону, якщо взяти до уваги двотижневий спад, який водночас зачепив і всі інші рівні.
Кумулятивна сума (CUSUM) залишків прогнозу (εi = yi − p̂i) сягнула дна на рівні −9,81 гри нижче очікування 7 березня 2026 року, після чого почала впевнено відновлюватися. Вона сягнула піку в 61,5% (8W–5L) на початку квітня та стабілізувалася на рівні 50% або вище протягом усієї весни.
Стабільність ознак і відсутність дрейфу коваріат
Два незалежні ланцюжки доказів спростовують наявність дефектів у конвеєрі даних чи просторі ознак:
Регресія залишків. Ми провели регресійний аналіз залишків наслідків εi = yi − p̂i за всіма 17 стандартизованими ознаками моделі за допомогою МНК (звичайних найменших квадратів), обмежившись вибіркою категорії Very Low. F-статистика на рівні всієї моделі показала p = 0,8216 зі скоригованим R-квадратом −0,0463. Жоден із 17 коефіцієнтів не досяг рівня значущості (найбільш наближена ознака, away_tov_pct_l10, отримала p = 0,2138). Якби просідання зумовлювала конкретна ознака — асиметрія відпочинку, поточна ефективність чи історія очних зустрічей, — це обов'язково проявилося б тут як значущий предиктор напряму похибки. Проте жодна ознака такого впливу не має.
Стабільність популяції. Порівняння розподілів ознак між першою та другою половинами сезону за допомогою індексу стабільності популяції (PSI) і двовибіркових критеріїв Колмогорова-Смирнова (KS) підтвердило стаціонарність ключових змінних: b2b_diff (PSI = 0,0107), away_optimal_rest (PSI = 0,0017), pf_l10_diff (PSI = 0,0396), pie_diff (PSI = 0,0591) — усі значення значно нижчі за поріг стабільності 0,10, а хвостові викиди (|z| > 3) для кожної ознаки не перевищили 2%. Ті кілька ознак, які дійсно зазнали суттєвого зміщення (home_l, PSI = 1,7666; h2h_dominance, PSI = 3,4364; home_e_net_rating, PSI = 0,3631), повною мірою відповідають природному перебігу сезону: накопичується кількість проведених ігор, ранній шум очних поєдинків нівелюється повторними зустрічами суперників, а розрив у турнірній таблиці збільшується в міру відриву лідерів від команд, що відверто зливають сезон. Жоден із цих факторів не свідчить про витік даних чи збій пайплайну.
Утім, спостерігається одна структурна закономірність, хоча вона має радше описовий характер, аніж указує на дефект: у категорії Very Low непропорційно часто трапляються матчі, де гостьова команда номінально переважає господарів за класом (w_diff: −1,42 проти +1,04 у контрольних групах, KS p < 0,0001). Оскільки засвоєне моделлю апріорне знання про перевагу домашнього майданчика діє проти такого розкладу, ці ігри за самою своєю будовою балансують на межі 50–55%. Коли модель у цьому вузькому діапазоні віддає перевагу саме гостям, точність падає до 43,4% (23W–30L) проти 49,3% (36W–37L) у випадках, коли вона обирає господарів. Це реальний, зрозумілий ефект структури вибірки, а не програмна помилка: протистояння з мінімальною різницею в класі та інверсією сили команд об'єктивно є найскладнішими для прогнозування подіями в усьому розкладі для будь-якого аналітика.
Діагностичний синтез
Зведення докупи результатів усіх чотирьох напрямів дослідження:
| Напрям | Головний показник | Доказова база | Висновок |
|---|---|---|---|
| 1. Статистична значущість | Біноміальне p = 0,2125 (ціль), p = 0,5331 (рівновага) | 95% ДІ [37,9%, 55,9%] повністю покриває цільові 52,48% | Відповідає шуму скінченної вибірки — підстав для відхилення H0 немає |
| 2. Розклад сигналу | Оцінка Брієра = 0,2531 (Rel = 0,0067, Res = 0,0022, Unc = 0,2490) | Нульова роздільна здатність усередині діапазону; піковий градієнт ∂P/∂z ≈ 0,2492 | Дефіцит роздільної здатності, а не збій калібрування чи надійності |
| 3. Природа спаду | Просідання до 23,8% (n = 21) проти 51,4% поза спадом (n = 105), критерій Фішера p = 0,0298 | Усі −11 перемог відставання припали на 14-денне вікно перед дедлайном | Локалізоване в часі гостре осідання, а не системний дрейф моделі |
| 4. Концентрація в сегментах | Поділ піддіапазону: 51,6% (n = 62) проти 42,2% (n = 64) | Дефіцит зосереджений у верхній частині; ознаки розкладу матчів і відпочинку стабільні (PSI < 0,05) | Локальна дисперсія у вузькому інтервалі без системного зміщення ознак |
Чотири незалежні лінії пошуку — перевірка статистичних гіпотез, розклад сигналу, локалізація в часі та аналіз стабільності ознак і вибірки — з чотирьох різних боків приводять до одного й того самого висновку. Саме ця узгодженість перетворює припущення «ймовірно, це шум» на обґрунтоване інженерне рішення.
Вжиті заходи щодо робочої моделі
Це саме та частина ретроспективного аналізу, де найлегше схибити. Побачивши червоні цифри, перший інстинкт — обов'язково щось зробити: підлаштувати параметри Платта, додати нові ознаки чи повторно навчити модель на зсунутому часовому вікні. У цьому випадку кожна з таких дій була б хибним кроком, і ось чому:
| Шлях виправлення | Стан | Обґрунтування |
|---|---|---|
| Повторне калібрування за Платтом | ❌ Відхилено | Параметри масштабування (A, B) працюють належним чином — p = 0,2125, рівномірне покриття ймовірностей у межах [0,50, 0,55). Повторна підгонка на вибірці n = 126, спотвореній відомим 14-денним шоком, призвела б до перенавчання на шумі та порушила б калібрування в сусідньому діапазоні, який наразі працює бездоганно. |
| Переробка простору ознак | ❌ Відхилено | Базові ознаки стаціонарні (PSI < 0,10), залишки не мають кореляції з жодною із 17 вхідних змінних (загальне p = 0,8216), а зафіксовані зміщення зуумовлені природною зміною фаз сезону, а не пошкодженням даних. Тут немає вади на рівні ознак, яку треба було б лагодити. |
| Регламент застосування категорій | ✅ Схвалено | Проблема має експлуатаційний, а не архітектурний характер: сприйняття діапазону [50,0%, 55,0%) як практично застосовного сигналу ігнорує той факт, що його стандартна похибка (4,44 в. п.) майже дорівнює ширині самого діапазону (5,0 в. п.), а роздільна здатність за Мерфі статистично прямує до нуля. |
На практиці ми впровадили три зміни:
- Зміна класифікації категорій. Діапазон [50,0%, 55,0%) отримав позначку «Нейтральний / Без дії» замість активної категорії прогнозування. Виведення прогнозу в робоче середовище тепер вимагає мінімальної ймовірності P ≥ 0.5500.
- Захисний буфер невизначеності. Оскільки емпірична стандартна похибка (4,44 в. п.) майже сягає повної ширини діапазону, ми встановили вимогу щодо запасу надійності щонайменше в 1.28 × SE ≈ 5.7 в. п. понад рівень 50,0% — що відповідає приблизно 90% однобічному довірчому буферу, — перш ніж прогноз отримає статус практично застосовної переваги.
- Аварійне гальмо на період підвищеної мінливості. Впроваджено діагностичний прапорець, який відстежує перевантаження календаря на зразок кінця січня: якщо рухома 14-денна точність контрольних категорій опускається нижче ніж 60%, пороги впевненості для всіх нижчих рівнів автоматично підвищуються, доки цей період не завершиться.
Жоден із цих кроків не вимагав втручання у ваги моделі. Класифікатор поводився саме так, як і має поводитися належно відкалібрована модель на межі власної впевненості: він чесно вказував на брак знань, а помилка полягала в тому, що ми побудували продуктове рішення на цій відвертості, не беручи до уваги межі математичної визначеності.
Загальний висновок: якщо один діапазон не досягає цільового показника протягом одного сезону, це саме по собі ще ні про що не свідчить. Перш ніж втручатися в модель, дайте послідовні відповіді на запитання: чи відрізняється розрив від шуму статистично; якщо ні, то чи заслуговує на увагу сама структура відхилення (часові скупчення, кореляція з ознаками, поведінка всередині піддіапазонів); і лише після того, як обидва напрями вичерпано, «повторне навчання» стає зваженим рішенням, а не рефлекторною реакцією.
Приєднуйтесь до подорожі
Preview Tier
Дивіться 1-2 прогнози щодня
Безкоштовно
Core Tier
Доступ до всіх прогнозів з рівнями впевненості
€9.90/місяць
Insight Tier
Повна методологія, розширена аналітика, дані калібрування
€24.90/місяць
Кожен прогноз має мітку часу. Кожен результат відстежується. Кожна метрика ефективності є публічною.
Тому що у світі заявок на 80%, чесність на рівні 67,5% є конкурентною перевагою.
Є питання щодо методології чи функцій моделі? Сторінка методології охоплює повний набір функцій, пайплайн навчання та підхід до калібрування. Дашборд калібрування показуuje показники Брієра, ECE та діаграми надійності, що оновлюються після кожної гри.