Что такое Brier score
Brier score — это мера точности вероятностного прогноза. Если прогноз выражен как вероятность события (например, «ставка вырастет с вероятностью 0.8»), Brier измеряет средний квадрат расстояния между этой вероятностью и тем, что произошло на самом деле. Чем меньше балл, тем точнее и калиброваннее прогнозы.
Ключевое свойство — это proper scoring rule: метрика устроена так, что в среднем выгоднее всего сообщать свою честную вероятность. Завышенная уверенность и трусливое «50 на 50» одинаково наказываются.
Формула
- pᵢ — заявленная вероятность события в i-м прогнозе (от 0 до 1).
- oᵢ — фактический исход: 1, если событие произошло, иначе 0.
- N — число прогнозов в выборке.
Минимум (0) достигается, когда автор каждый раз ставит вероятность, совпавшую с исходом. Максимум (1) — когда автор уверенно (вероятность 1) ошибся во всех прогнозах.
Примеры
| Прогноз (p) | Исход (o) | Вклад (p − o)² | Комментарий |
|---|---|---|---|
| 0.80 | 1 (сбылось) | 0.04 | Уверенно и верно — почти идеал. |
| 0.80 | 0 (не сбылось) | 0.64 | Уверенно и неверно — крупный штраф. |
| 0.50 | 0 или 1 | 0.25 | «50/50» всегда стоит 0.25 — без информации. |
| 0.95 | 0 (не сбылось) | 0.90 | Переуверенность наказывается жёстче всего. |
От Brier к skill-score
Сам по себе Brier зависит от того, насколько события вообще предсказуемы: на почти предрешённых исходах низкий балл получить легко. Поэтому для FRI мы переводим Brier в относительный skill-score — сравнение с базовой линией.
skill = 0 означает паритет с базовой линией (и FRI = 50). Подробно о том, как skill превращается в индекс, — на странице об FRI.
Бинарные и многоисходные прогнозы
Многие прогнозы здесь по сути бинарны: «порог будет пройден» или нет. Для них Brier сводится к простой форме выше. Когда прогноз многосоставной (несколько условий), он раскладывается на проверяемые компоненты, а частичное исполнение отражается как исход «частично» — см. правила резолюции.
Мы фиксируем высказывания, а не людей
Объект оценки — конкретное публичное утверждение о будущем, а не личность автора. Мы судим прогноз: что именно было сказано, когда, с каким горизонтом и по какому источнику истины это проверяется. Один и тот же человек может иметь и сбывшиеся, и несбывшиеся прогнозы — и то, и другое попадает в выборку без отбора «удобных» случаев.
Поэтому здесь нет ярлыков «эксперт» или «шарлатан». Есть числа: сколько проверяемых прогнозов, сколько из них сбылось, с какой точностью относительно базовой линии. Формулировки фактологичны — «из N проверяемых M сбылись», без оценочных характеристик автора.
Ограничения (честно)
- Нужна вероятность. Brier определён для вероятностных прогнозов. Если автор не назвал вероятность (категоричное «ставка вырастет»), мы её не выдумываем: подставляем базовую линию, и тогда skill = 0 — прогноз не влияет на FRI, но учитывается в hit-rate. Поэтому на текущем корпусе, где вероятности почти не заявляют, FRI у большинства держится у паритета, а авторов сравнивают по hit-rate.
- Чувствительность к базовой линии. Skill-score зависит от выбора опорной вероятности; при отсутствии консенсуса берутся наивные 0.5, и это может смещать оценку для почти предрешённых событий.
- Малые выборки. На нескольких прогнозах средний Brier неустойчив — отсюда доверительные интервалы и статусы research / preview / final.
- Не различает типы ошибок. Brier суммирует отклонения; он не говорит, систематически ли автор переоценивает рост или падение — это отдельный анализ калибровки.
История версий методологии
Здесь — изменения правил (как считается индекс, что считается прогнозом, как резолвится исход). Ошибки в конкретных вердиктах фиксируются отдельно — в журнале исправлений. Это разные вещи: тут меняется метод, там — исправляется ошибка применения метода.
Интервал Уилсона на hit-rate, ранжирование по нижней границе, стратификация и поправка на базовую частоту.
- Интервал Уилсона (95%) на hit-rate: рядом с долей показывается доверительный интервал [нижняя–верхняя], отражающий неопределённость на малой выборке.
- Ранжирование лидерборда — по нижней границе интервала Уилсона, а не по точечной доле. «3 из 5» (60%, но широкий интервал) больше не встаёт над стабильным треком на шуме; FRI остаётся тай-брейком, эксперты без hit-данных — в конце.
- Стратификация: hit-rate раскладывается по стратам (тип прогноза × класс актива). Видно, что 90% попаданий у эксперта — это направления по валюте, а не точные уровни ставки. Разбивка показана на профиле эксперта.
- Базовая частота и «над базой» (skill-over-chance): для каждой страты считается объединённая по всему корпусу частота сбываемости (включая прогнозы самого эксперта); эксперт сравнивается с ней с поправкой на трудность его набора прогнозов. Значение может быть отрицательным — показывается честно. У доминирующего в выборке эксперта база близка к его же частоте, поэтому «над базой» на текущем корпусе — консервативная оценка.
- Новых ручных порогов не введено: z=1.96 фиксирован, базовые частоты вычисляются из корпуса. Обратная совместимость: старые прогнозы не перерезолвлены, изменился только показ и порядок сортировки.
Диапазоны автоматически скорятся: вхождение + допуск класса на границах.
- Правило диапазонов (§5): вместо «ждать ручной проверки» диапазон теперь скорится автоматически — факт должен попасть в [low − δ, high + δ], где δ — допуск класса актива на соответствующей границе.
- Ширина диапазона шире класс-зависимого cap → флаг range_too_wide: прогноз закрыт и показан на карточке, но исключён из hit-rate и FRI (слишком широкий диапазон не является точным прогнозом).
- «Мусорные» диапазоны (нечитаемые границы, нижняя граница ≤ 0, расхождение с фактом > 5×, ширина > 3×cap, сложная агрегация/нелинейный путь) — направляются в очередь ручной проверки; вердикт не выставляется до решения оператора.
- Границы с пометкой manual_verified (оператор проверил вручную) обходят очередь и скорятся напрямую.
- Параметры правила (cap ширины, допуски, флаги auto_score_ranges) хранятся в таблице methodology_config (draft → publish → версионирование) и доступны в /admin-ui/methodology; ночной конвейер читает опубликованный конфиг.
Подключены источники истины (CPI, крипто, Urals) и зафиксирована политика эталонов.
- Политика эталонов: у каждого скоримого актива — один источник истины, решающий вердикт (показан на карточке); вторичные источники служат резервом и сверкой, но не перебивают основной. Где надёжного эталона нет — прогноз не оценивается (monitoring), а не получает сомнительный вердикт.
- Инфляция (CPI) — подключена авторезолюция по годовому ИПЦ Росстата (декабрь к декабрю), с перекрёстной сверкой по Банку России. Раньше CPI-прогнозы оставались открытыми.
- Криптовалюты (BTC/ETH) — дневное закрытие Kraken (UTC) как основной источник, сверка с Coinbase, резерв CoinGecko; институциональный бенчмарк — CME CF Bitcoin/Ether Reference Rate.
- Нефть Urals — официальная средняя цена Минэкономразвития за месяц/год (на данных Argus): скорятся только средние прогнозы; дневные spot-прогнозы помечаются monitoring (нет бесплатного дневного эталона).
- Закрыт пробел: акции ЛУКОЙЛ/Норникель/ВТБ (LKOH/GMKN/VTBR) теперь резолвятся по Московской бирже наравне с остальными. Введён инвариант: каждый актив имеет источник резолюции — без тихих пропусков.
Допуски по рыночным классам сужены ради доверия к вердикту.
- Допуски рынков сужены: валюта — ±1,5% на горизонте до 90 дней, ±2% дальше (±3% только для явно сценарных долгосрочных); индексы, отдельные акции, нефть/золото и крипто — ±2%. Прежние ±5–10% признаны слишком широкими: большой допуск размывает смысл «сбылось / не сбылось».
- Ключевая ставка (точное совпадение, ±0,25 п.п. при «около») и инфляция/CPI (±0,3 п.п., ±0,5 п.п. при «около») оставлены без изменений.
- Ранее разрешённые рыночные прогнозы перерезолвлены по новым допускам; часть вердиктов и значения hit-rate/FRI соответственно обновлены.
Класс-зависимые допуски, операторы порога и шаг ставки.
- Единый «±5%» заменён допуском по классу актива: ключевая ставка — точное совпадение (или ±0,25 п.п. при «около»); CPI ±0,3 п.п.; валюта ±2,5–3%; индексы ±5%; акции ±7,5%; нефть/золото ±5%; крипто ±10%.
- Введены операторы сравнения: «достигнет/превысит/не ниже» → порог (≥/>), «не выше/упадёт до» → ≤; «снизит на N б.п./сохранит» резолвится по фактическому шагу ставки, а не по уровню.
- Числовые точечные прогнозы теперь участвуют в рейтинге (резолвятся по допуску в сбылось/не сбылось); диапазоны идут в рейтинг только после ручной проверки границ.
- База направления — значение на момент прогноза, а не за день до горизонта. «Средняя за период» считается как среднее ряда за период.
- Прогнозы про ФРС/ЕЦБ не резолвятся против ставки ЦБ РФ; добавлены источники Brent (EIA/FRED) и золота (LBMA в $/унц., учётные цены ЦБ в ₽/грамм с базисом).
- Карточка прогноза показывает цель, факт, ошибку, допуск, оператор, источник истины, эффективную дату и причину исхода.
- Brier-skill начисляется только за явно заявленную вероятность; категориальные и точечные прогнозы без вероятности получают skill 0 (идут в hit-rate, но не штрафуются за подставленную «уверенность») — убрана асимметрия прежней оценки.
- Сжатие индекса — к паритету (skill 0 → FRI 50), а не к популяционному среднему; σ доверительного интервала оценивается из данных (не ниже 0,5).
- Главная публичная метрика — доля сбывшихся (hit-rate); FRI предварительный, ярлык «итоговый рейтинг» не присваивается, пока не накопятся вероятностные прогнозы.
Первая публичная версия правил.
- Зафиксирована формула FRI: skill-score против опорной вероятности, веса по горизонту / ясности / тиру источника / свежести, байесовское сжатие к среднему (k = 8), отображение в шкалу 0–100 (50 = паритет).
- Введены тиры источников T1–T3 и правило резолюции по единственному источнику истины на актив.
- Введён порог research / preview / final по числу разрешённых сравнимых прогнозов (финал — от 20 на эксперта).
Хотите узнавать, когда мы меняем правила? Напишите нам — добавим вас в список оповещения об изменениях методологии (это отдельный канал от журнала исправлений).
Частые вопросы
Частые вопросы
- Почему «50 на 50» — это плохо?
- Потому что такой прогноз не несёт информации и всегда стоит 0.25. Метрика поощряет осмысленное отклонение от неопределённости, а не уход от ответа.
- Хороший Brier — это какой?
- Зависит от предсказуемости событий. Поэтому мы смотрим не на абсолютный Brier, а на skill-score — насколько он лучше базовой линии.
- Как Brier связан с FRI?
- FRI строится из skill-score, а skill — из отношения Brier автора к Brier базовой линии. Brier — это «сырьё» индекса.
