Методология · v1.4

Тиры доказательств: T1 → T2 → T3

Прогноз ценен ровно настолько, насколько надёжно зафиксировано, что он был сделан. Тир источника (T1–T3) и ясность формулировки задают вес прогноза в индексе.

Коротко
Каждый прогноз привязан к источнику, который оценивается по тиру надёжности: T1 — первоисточник (стенограмма, официальная публикация, прямое интервью), T2 — авторитетный пересказ со ссылкой на оригинал, T3 — вторичный источник. Чем выше тир и чище формулировка, тем больше вес прогноза.
первоисточник
пересказ
вторичный
Актуально на 2026-08-08Источник истины: ForecastReceipts

Что такое тир доказательства

Тир доказательства (evidence grade) — это уровень надёжности того, что конкретное высказывание действительно было сделано данным автором в данный момент. Мы отделяем сам прогноз (его судим) от доказательства его существования (его оцениваем тиром). Слабое доказательство — слабый вес: на пересказе в третьих руках строить вердикт нельзя.

Тиры T1–T3

ТирЧто относитсяПример
первоисточникПервоисточник: официальная публикация, стенограмма, прямое интервью, документ автора.Стенограмма выступления на сайте ЦБ; авторская колонка за подписью.
крупное СМИАвторитетный пересказ со ссылкой на проверяемый первоисточник.Заметка крупного СМИ, цитирующая эксперта с указанием оригинала.
вторичный источникВторичный источник без прямой ссылки на оригинал.Пересказ без ссылки; агрегатор цитат. Принимается с пониженным весом или не принимается.

Ясность формулировки

Параллельно тиру источника оценивается ясность самого прогноза: есть ли актив, направление, порог и срок. Размытое утверждение нельзя честно проверить, поэтому оно весит меньше — или не принимается в индекс.

90«USD/RUB ≥ 100 к 31.12.2025» — высокая ясность
20«Рубль ждёт непростой год» — низкая ясность

Архивирование источников

Ссылки в сети исчезают, а страницы переписывают. Поэтому при фиксации прогноза мы сохраняем доказательство в несколько слоёв — насколько это позволяет источник: читатель может проверить оригинал, даже если страница удалена или изменена.

  • Дословная цитата — точная формулировка прогноза из источника.
  • Прямая ссылка и домен первоисточника с тиром надёжности T1–T3.
  • Архивная копия в Wayback Machine — где внешний архиватор берёт страницу.
  • Собственный датированный снимок текста с отпечатком SHA-256: контент-адресуемая копия, устойчивая к подмене и независимая от archive.org.
  • Скриншот страницы-источника — где его удаётся снять.
  • Дата захвата фиксируется при добавлении.

Честно: часть российских источников блокируют и внешний архиватор, и автоматический скриншот. Для таких прогнозов доказательство держится на дословной цитате и нашем датированном снимке текста, а недоступность оригинала отражается в тире источника и его весе. Резолюция исхода при этом опирается на источник истины актива (биржа/ЦБ), а не на пересказ.

Как это влияет на вес

Тир источника и ясность входят в вес прогноза при усреднении skill-score в индексе FRI. Прогноз T1 с чёткой формулировкой вносит максимальный вклад; размытое высказывание из вторичного источника — минимальный.

Принцип «читатель проверит сам»

Мы не просим верить на слово: к каждому прогнозу прилагается дословная цитата и ссылка на первоисточник, а где источник это позволяет — архивная копия, датированный снимок текста с отпечатком SHA-256 и скриншот. Тир — это краткая сводка того, насколько легко читателю воспроизвести проверку.

Мы фиксируем высказывания, а не людей

Объект оценки — конкретное публичное утверждение о будущем, а не личность автора. Мы судим прогноз: что именно было сказано, когда, с каким горизонтом и по какому источнику истины это проверяется. Один и тот же человек может иметь и сбывшиеся, и несбывшиеся прогнозы — и то, и другое попадает в выборку без отбора «удобных» случаев.

Поэтому здесь нет ярлыков «эксперт» или «шарлатан». Есть числа: сколько проверяемых прогнозов, сколько из них сбылось, с какой точностью относительно базовой линии. Формулировки фактологичны — «из N проверяемых M сбылись», без оценочных характеристик автора.

Ограничения (честно)

  • Survivorship bias архивов. Хорошо архивированные источники представлены полнее, чем то, что исчезло до фиксации. Это смещает выборку к «выжившим» публикациям.
  • Субъективность границ тира. Граница между T2 и T3 не всегда однозначна; в спорных случаях возможна переоценка — она фиксируется в журнале исправлений.
  • Некалиброванность ясности. Оценка ясности субъективна на границах и может недооценивать конкретность сложных формулировок.
  • Неполнота охвата. Мы фиксируем не всё: устные высказывания без записи или закрытые публикации в базу не попадают.

История версий методологии

Здесь — изменения правил (как считается индекс, что считается прогнозом, как резолвится исход). Ошибки в конкретных вердиктах фиксируются отдельно — в журнале исправлений. Это разные вещи: тут меняется метод, там — исправляется ошибка применения метода.

v1.4

Интервал Уилсона на hit-rate, ранжирование по нижней границе, стратификация и поправка на базовую частоту.

  • Интервал Уилсона (95%) на hit-rate: рядом с долей показывается доверительный интервал [нижняя–верхняя], отражающий неопределённость на малой выборке.
  • Ранжирование лидерборда — по нижней границе интервала Уилсона, а не по точечной доле. «3 из 5» (60%, но широкий интервал) больше не встаёт над стабильным треком на шуме; FRI остаётся тай-брейком, эксперты без hit-данных — в конце.
  • Стратификация: hit-rate раскладывается по стратам (тип прогноза × класс актива). Видно, что 90% попаданий у эксперта — это направления по валюте, а не точные уровни ставки. Разбивка показана на профиле эксперта.
  • Базовая частота и «над базой» (skill-over-chance): для каждой страты считается объединённая по всему корпусу частота сбываемости (включая прогнозы самого эксперта); эксперт сравнивается с ней с поправкой на трудность его набора прогнозов. Значение может быть отрицательным — показывается честно. У доминирующего в выборке эксперта база близка к его же частоте, поэтому «над базой» на текущем корпусе — консервативная оценка.
  • Новых ручных порогов не введено: z=1.96 фиксирован, базовые частоты вычисляются из корпуса. Обратная совместимость: старые прогнозы не перерезолвлены, изменился только показ и порядок сортировки.
v1.3.1

Диапазоны автоматически скорятся: вхождение + допуск класса на границах.

  • Правило диапазонов (§5): вместо «ждать ручной проверки» диапазон теперь скорится автоматически — факт должен попасть в [low − δ, high + δ], где δ — допуск класса актива на соответствующей границе.
  • Ширина диапазона шире класс-зависимого cap → флаг range_too_wide: прогноз закрыт и показан на карточке, но исключён из hit-rate и FRI (слишком широкий диапазон не является точным прогнозом).
  • «Мусорные» диапазоны (нечитаемые границы, нижняя граница ≤ 0, расхождение с фактом > 5×, ширина > 3×cap, сложная агрегация/нелинейный путь) — направляются в очередь ручной проверки; вердикт не выставляется до решения оператора.
  • Границы с пометкой manual_verified (оператор проверил вручную) обходят очередь и скорятся напрямую.
  • Параметры правила (cap ширины, допуски, флаги auto_score_ranges) хранятся в таблице methodology_config (draft → publish → версионирование) и доступны в /admin-ui/methodology; ночной конвейер читает опубликованный конфиг.
v1.3

Подключены источники истины (CPI, крипто, Urals) и зафиксирована политика эталонов.

  • Политика эталонов: у каждого скоримого актива — один источник истины, решающий вердикт (показан на карточке); вторичные источники служат резервом и сверкой, но не перебивают основной. Где надёжного эталона нет — прогноз не оценивается (monitoring), а не получает сомнительный вердикт.
  • Инфляция (CPI) — подключена авторезолюция по годовому ИПЦ Росстата (декабрь к декабрю), с перекрёстной сверкой по Банку России. Раньше CPI-прогнозы оставались открытыми.
  • Криптовалюты (BTC/ETH) — дневное закрытие Kraken (UTC) как основной источник, сверка с Coinbase, резерв CoinGecko; институциональный бенчмарк — CME CF Bitcoin/Ether Reference Rate.
  • Нефть Urals — официальная средняя цена Минэкономразвития за месяц/год (на данных Argus): скорятся только средние прогнозы; дневные spot-прогнозы помечаются monitoring (нет бесплатного дневного эталона).
  • Закрыт пробел: акции ЛУКОЙЛ/Норникель/ВТБ (LKOH/GMKN/VTBR) теперь резолвятся по Московской бирже наравне с остальными. Введён инвариант: каждый актив имеет источник резолюции — без тихих пропусков.
v1.2

Допуски по рыночным классам сужены ради доверия к вердикту.

  • Допуски рынков сужены: валюта — ±1,5% на горизонте до 90 дней, ±2% дальше (±3% только для явно сценарных долгосрочных); индексы, отдельные акции, нефть/золото и крипто — ±2%. Прежние ±5–10% признаны слишком широкими: большой допуск размывает смысл «сбылось / не сбылось».
  • Ключевая ставка (точное совпадение, ±0,25 п.п. при «около») и инфляция/CPI (±0,3 п.п., ±0,5 п.п. при «около») оставлены без изменений.
  • Ранее разрешённые рыночные прогнозы перерезолвлены по новым допускам; часть вердиктов и значения hit-rate/FRI соответственно обновлены.
v1.1

Класс-зависимые допуски, операторы порога и шаг ставки.

  • Единый «±5%» заменён допуском по классу актива: ключевая ставка — точное совпадение (или ±0,25 п.п. при «около»); CPI ±0,3 п.п.; валюта ±2,5–3%; индексы ±5%; акции ±7,5%; нефть/золото ±5%; крипто ±10%.
  • Введены операторы сравнения: «достигнет/превысит/не ниже» → порог (≥/>), «не выше/упадёт до» → ≤; «снизит на N б.п./сохранит» резолвится по фактическому шагу ставки, а не по уровню.
  • Числовые точечные прогнозы теперь участвуют в рейтинге (резолвятся по допуску в сбылось/не сбылось); диапазоны идут в рейтинг только после ручной проверки границ.
  • База направления — значение на момент прогноза, а не за день до горизонта. «Средняя за период» считается как среднее ряда за период.
  • Прогнозы про ФРС/ЕЦБ не резолвятся против ставки ЦБ РФ; добавлены источники Brent (EIA/FRED) и золота (LBMA в $/унц., учётные цены ЦБ в ₽/грамм с базисом).
  • Карточка прогноза показывает цель, факт, ошибку, допуск, оператор, источник истины, эффективную дату и причину исхода.
  • Brier-skill начисляется только за явно заявленную вероятность; категориальные и точечные прогнозы без вероятности получают skill 0 (идут в hit-rate, но не штрафуются за подставленную «уверенность») — убрана асимметрия прежней оценки.
  • Сжатие индекса — к паритету (skill 0 → FRI 50), а не к популяционному среднему; σ доверительного интервала оценивается из данных (не ниже 0,5).
  • Главная публичная метрика — доля сбывшихся (hit-rate); FRI предварительный, ярлык «итоговый рейтинг» не присваивается, пока не накопятся вероятностные прогнозы.
v0.1

Первая публичная версия правил.

  • Зафиксирована формула FRI: skill-score против опорной вероятности, веса по горизонту / ясности / тиру источника / свежести, байесовское сжатие к среднему (k = 8), отображение в шкалу 0–100 (50 = паритет).
  • Введены тиры источников T1–T3 и правило резолюции по единственному источнику истины на актив.
  • Введён порог research / preview / final по числу разрешённых сравнимых прогнозов (финал — от 20 на эксперта).

Хотите узнавать, когда мы меняем правила? Напишите нам — добавим вас в список оповещения об изменениях методологии (это отдельный канал от журнала исправлений).

Частые вопросы

Частые вопросы

Что произойдёт, если источник удалят?
Прогноз остаётся проверяемым по архивной копии в Wayback и сохранённой цитате. Дата захвата фиксируется при добавлении.
Почему вторичный пересказ весит меньше?
Потому что его сложнее проверить и легче исказить. Чем дальше от первоисточника, тем ниже тир и вес.
Тир — это оценка автора?
Нет. Тир оценивает надёжность доказательства, что высказывание было сделано, а не качество самого прогноза.

Другие страницы методологии

Обновлено