Czytaj książkę: «Профессия - аналитик букмекерской компании»

Czcionka:

БОЛЬШОЙ ПРАКТИЧЕСКИЙ КУРС

ПРОФЕССИЯ «АНАЛИТИК БУКМЕКЕРСКОЙ КОМПАНИИ»

Статистика и данные. Вероятности и коэффициенты. Футбольные модели.

ML и калибровка. Линия и CLV. Серии и live. KNN и стратегии.

12 модулей · 120 уроков · 18 чек-листов · глоссарий

Второе издание — переработанное и расширенное

Учебные примеры не гарантируют прибыль: книга о качестве решений и дисциплине анализа.

Как устроена и как пользоваться книгой

Книга построена как маршрут: от перевода коэффициентов в вероятности (модуль 2) — к инженерной системе, которая получает данные, строит вероятность, сравнивает её с рынком, проверяет калибровку и следит, не исчез ли сигнал (модули 8–9). Финальный модуль собирает всё в защищаемый проект.

Каждый урок имеет постоянную структуру: «Суть» (теория с оглядкой на практику), «Формула» (минимум математики, который надо уметь воспроизвести), «Пример с числами» (кейс с честной арифметикой), «Типичные ошибки» (каталог самообмана по теме), «Задание» (применение к вашим данным) и «Вопросы для самопроверки». Уроки 9 и 10 каждого модуля — практикум и контроль: интегральный кейс и вопросы с эталонными ответами.

Три способа чтения. Линейный — для первого прохода: книга не перескакивает через зависимости. Проектный — для практика: читайте модули 2–3, затем сразу модуль 10, возвращаясь к тематическим блокам по запросу проекта. Справочный — для работающего стола: приложения в конце книги — это восемнадцать плотных чек-листов, заточенных под операционное использование.

Практическое правило курса, повторяемое намеренно до навязчивости: любая гипотеза проходит один путь — baseline → временной backtest → out-of-sample → forward test → оценка неопределённости. Книга считается усвоенной, когда эта цепочка выполняется автоматически, а не вспоминается.

Карта курса
Важно: о границах применимости

□ Модуль 1. Профессия аналитика — роль, данные, вероятность как язык, дисциплина процесса.

□ Модуль 2. Вероятности и коэффициенты — имплайд-вероятности, маржа, devig, EV и чувствительность.

□ Модуль 3. Статистика и данные — выборки, бутстрэп, утечки, множественные сравнения, временные разрезы.

□ Модуль 4. Футбольные модели — Пуассон, Skellam, Dixon–Coles, xG, рейтинги атаки и защиты.

□ Модуль 5. ML и калибровка — бустинг/лес/логрегрессия, log loss, Brier, reliability, ансамбли.

□ Модуль 6. Линия и CLV — жизненный цикл цены, price discovery, окна исполнения.

□ Модуль 7. Серии и тренды — автокорреляция, EWMA, марковские состояния, change points, регрессия к среднему.

□ Модуль 8. Live / in-play — state-space, hazard rate, latency, скрытые состояния.

□ Модуль 9. Аналитический стол — пайплайны, дашборды, алерты, реестр моделей, пост-мортемы.

□ Модуль 10. Финальный проект — полный цикл от датасета до защиты.

□ Спецблок. KNN — ближайшие соседи: метрики, веса, локальные режимы, поиск аналогов.

□ Research. Стратегии сообщества — CLV, line shopping, stale lines, миддлинг, арбитраж, пропсы, тайминг.

Книга посвящена аналитике и исследовательским методам. Ни один метод курса не гарантирует прибыль: спортивные рынки — конкурентная среда, где большинство участников проигрывает маржу, а финансовый результат любой стратегии подвержен сильной дисперсии на любых практических горизонтах.

Все числовые примеры носят учебный характер и опираются на упрощённые или синтетические данные; совпадения с реальными рынками случайны. Реальные решения требуют риск-менеджмента, контроля качества данных, юридической проверки применимости в вашей юрисдикции и ответственного отношения к азартным играм.

Если азартные игры перестают быть развлечением и начинают влиять на вашу жизнь — обратитесь за профессиональной помощью. Информация о линиях поддержки доступна в вашем регионе.

Модуль 1. Профессия аналитика

Роль, мышление, данные и рабочий процесс спортивного аналитика

Аналитик букмекерской компании — это не человек, который «хорошо разбирается в спорте». Это специалист, который превращает неопределённость спортивных событий в измеримые вероятности, а вероятности — в устойчивые решения под давлением рынка. Его продукт — не прогнозы, а воспроизводимый процесс: от постановки гипотезы до проверки результата.

В этом модуле мы разбираем, как устроена профессия изнутри: чем аналитик отличается от каппера и от data-инженера, какие данные он использует, что такое benchmark и почему без базовой линии не существует ни одного «успешного» результата. Отдельно разбираем типичные ошибки мышления, культуру документации и командную работу.

Ключевая мысль модуля: доказательство важнее истории. Красивая логика «почему команда должна выиграть» ничего не стоит, пока гипотеза не сформулирована до результата, не проверена на отложенной выборке и не сравнена с простой альтернативой.

ЧЕМУ ВЫ НАУЧИТЕСЬ В ЭТОМ МОДУЛЕ

• Понять границы роли: что аналитик делает и чего он не делает

• Научиться фиксировать момент доступности информации до построения модели

• Освоить понятия baseline, benchmark и предрегистрация гипотезы

• Разобрать типичные когнитивные ошибки спортивного аналитика

• Построить личный процесс: гипотеза → данные → проверка → вывод

1.1. Роль аналитика: кто он и за что отвечает

Аналитик в букмекерской индустрии отвечает за качество чисел, а не за яркость мнений. Его основной артефакт — оценка вероятности исхода, полученная воспроизводимым способом: из зафиксированных данных, по зафиксированной процедуре, с измеренной исторической точностью. Если оценку нельзя воспроизвести по описанию процесса — это не оценка, а мнение.

Внутри профессии выделяют три контура. Первый — исследовательский: поиск сигналов, формализация гипотез, отсеивание случайных закономерностей. Второй — продуктово-инженерный: подготовка данных, мониторинг моделей, поддержка линии. Третий — управленческий: оценка риска, лимиты, коммуникация с трейдерами. На старте карьеры почти всё время занимает первый контур, и именно в нём закладываются профессиональные привычки.

Принципиальная граница роли: аналитик не «предсказывает будущее». Он оценивает распределение вероятностей и сравнивает его с рыночной ценой. Даже модель с долгосрочным преимуществом будет регулярно ошибаться в отдельных событиях — профессионализм измеряется качеством процесса на дистанции, а не исходом конкретного матча.

Кейс: два аналитика и один матч

Аналитик А говорит: «Команда в отличной форме, соперник уставший после еврокубков — берём победу хозяев». Аналитик Б фиксирует: вероятность победы хозяев по его модели 0.54 при рыночной имплайд-вероятности 0.48; сигнал получен из признаков, доступных за 48 часов до матча; на отложенной выборке из 1 200 событий подобного рода модель показала Brier 0.205 против 0.213 у базовой линии. Матч заканчивается вничью. Для внешнего наблюдателя оба «ошиблись». Для профессионала разница принципиальна: решение А невозможно ни повторить, ни улучшить, ни проверить; решение Б — элемент статистики, которая через сотни повторений покажет истинное качество процесса. Из кейса следует рабочее правило: оценивайте решения, а не исходы. Плохое решение иногда выигрывает, хорошее иногда проигрывает — но только второе масштабируется.

ТИПИЧНЫЕ ОШИБКИ

✗ Путать роль аналитика с ролью прогнозиста: цель не «угадать матч», а построить процесс, стабильно оценивающий вероятности.

✗ Измерять себя отдельными событиями, а не распределением результатов на дистанции.

✗ Подменять доказательство уверенным тоном: убедительная формулировка не увеличивает точность модели ни на долю процента.

ЗАДАНИЕ

Опишите паспорт своего рабочего процесса на одну страницу: какие данные вы используете, в какой момент они доступны, какой у вас baseline, какую метрику качества считаете главной и при каком результате вы признаёте гипотезу проваленной. Сохраните документ — в конце курса вы сравните его с итоговой версией.

Вопросы для самопроверки

1. Чем артефакт аналитика отличается от прогноза каппера?

2. Почему выигрыш одиночного события не подтверждает качество решения?

3. Назовите три контура работы аналитика и их главные артефакты.

1.2. Данные: что мы знаем и когда мы это узнали

Центральный вопрос работы с данными — не «что в таблице», а «что было известно в момент прогноза». Спортивная история переписывается задним числом постоянно: составы уточняются, травмы публикуются с задержкой, статистика матчей исправляется, коэффициенты закрытия появляются после события. Если обучить модель на «окончательных» версиях данных, она незаметно подсмотрит в будущее.

Профессиональная привычка — у каждого признака хранить метку времени доступности: timestamp публикации, задержку источника, дату последнего обновления. Для каждого прогноза собирается срез «как было на момент T»: только строки, опубликованные до T. Это называется point-in-time discipline, и именно она отделяет исследование от самообмана.

Второй аспект — происхождение данных. Любой источник имеет лицензию, задержку, политику исправлений и историю сбоев. Аналитик документирует все четыре свойства. Дешёвый источник с честной историей ошибок ценнее дорогого «чёрного ящика», потому что позволяет оценить, какой шум заложен в модель уже на входе.

ДИСЦИПЛИНА POINT-IN-TIME


Обучающий набор для прогноза события в момент T включает только наблюдения с меткой доступности не позже T. Всё, опубликованное позже, для этого прогноза не существует.

Кейс: «утёкший» состав

Модель предсказывала результативность фаворита с фантастической точностью: log loss на истории выглядел лучше рыночного. Разбор показал причину: в обучающей выборке стояли стартовые составы из официального протокола — документа, публикуемого после матча, но датированного часом начала. Модель честно «узнавала» из будущего, выйдет ли травмированный форвард. После замены составов на пресс-конференции за день до игры точность упала ниже базовой линии. Вывод не «модель плохая», а «предыдущая оценка была измерением утечки, а не сигнала». Практический тест на утечку: спросите по каждому признаку, могли ли вы получить его значение в момент прогноза, заплатив обычную цену и подождав обычную задержку источника. Если нет — признак отклоняется.

ТИПИЧНЫЕ ОШИБКИ

✗ Использовать «финальную» версию статистики вместо версии, опубликованной до события.

✗ Игнорировать время появления коэффициентов: цена закрытия недоступна до закрытия.

✗ Не фиксировать источник и его историю исправлений — шум входа прячется в модель.

ЗАДАНИЕ

Возьмите свой текущий набор признаков и выпишите для каждого: источник, момент публикации относительно начала события, типичную задержку, случаи ретроактивных исправлений. Отметьте признаки, которые не проходят point-in-time проверку, и переведите их в раздел «вспомогательная аналитика, не для обучения».

Вопросы для самопроверки

1. Что такое point-in-time discipline и почему без неё бесполезен любой backtest?

2. Приведите два примера данных, которые чаще всего «текут из будущего».

3. Какие четыре свойства источника данных документирует аналитик?

1.3. Вероятность: язык профессии

Вероятность — единственная валюта, в которой аналитик сравнивает свои суждения с чужими. Фраза «команда сильнее» непроверяема; фраза «победа хозяев с вероятностью 0.58» проверяема статистически: на большом числе похожих оценок примерно 58 % событий должны заканчиваться победой. Это свойство называется калибровкой и является первым критерием осмысленности любой модели.

Фундаментальное свойство монетной (и спортивной) неопределённости: одиночное событие не может ни подтвердить, ни опровергнуть вероятность. Если вы оценили шансы 70 на 30 и случилось «30» — это не ошибка, это реализация хвоста распределения. Выводы делаются только по частотам больших выборок и по совокупным метрикам: Brier score, log loss, reliability-кривой.

Поэтому профессиональный словарь заменяет «уверен/не уверен» на «модель даёт 0.64 при историческом Brier 0.21 на 3 000 событий». Такая фраза содержит оценку, меру её качества и размер доказательной базы — всё, что нужно для рабочего решения.

ЭМПИРИЧЕСКАЯ ПРОВЕРКА КАЛИБРОВКИ



Разбиваем прогнозы на корзины по уровню вероятности; внутри корзины из n событий наблюдаемая частота должна совпадать со средней оценкой в пределах статистического шума.

Кейс: «60 %» на практике

Модель выдала за сезон 400 прогнозов с оценками в диапазоне 0.55–0.65. Средняя оценка в корзине — 0.60, наблюдаемая доля успехов — 0.545. Стандартная ошибка при n = 400 равна √(0.6·0.4/400) ≈ 0.0245; отклонение 0.055 — чуть больше двух стандартных ошибок. Это повод перепроверить калибровку, но не повод объявлять модель сломанной: две сигмы случаются у честных моделей примерно раз в двадцать проверок. На встречной выборке из 1 200 событий отклонение сократилось до 0.012 — предположение о систематическом смещении не подтвердилось. Урок: решения о перестройке модели принимаются на выборках, где шум мал по сравнению с эффектом, а не на эмоциях от одной неудачной корзины.

ТИПИЧНЫЕ ОШИБКИ

✗ Оценивать качество вероятности по одиночному событию — по определению невозможно.

✗ Выдавать точечную оценку без указания выборки, на которой измерено её качество.

✗ Считать «высокую вероятность» синонимом «обязательно произойдёт».

ЗАДАНИЕ

Выберите любой свой исторический массив прогнозов (или котировки закрытия как их замену). Постройте reliability-таблицу: разбейте оценки на корзины 0–0.1, 0.1–0.2, …, посчитайте в каждой среднюю оценку, фактическую частоту и размер корзины. Отметьте корзины, где отклонение больше двух стандартных ошибок.

Вопросы для самопроверки

1. Почему одиночное событие не проверяет вероятность?

2. Что такое калибровка и как её проверить на корзинах?

3. Какие три числа должен содержать профессиональный ответ о прогнозе?

1.4. Benchmark: без базовой линии нет результата

Любая модель всего лишь доказывает, что она лучше выбранной альтернативы. Поэтому прежде, чем строить «умную» систему, аналитик фиксирует baseline — простое воспроизводимое правило, которое обязана обыгрывать любая серьёзная методика. Без зафиксированной базовой линии цифра качества не интерпретируется: Brier 0.21 — это хорошо или плохо? Ответ существует только относительно конкурента.

В спортивной аналитике иерархия базовых линий примерно такова: (0) частота класса в обучающей истории («дома побеждают в 46 % случаев»); (1) рейтинг-команды без учёта контекста (Elo с фиксированными параметрами); (2) рыночная цена без маржи (devig closing). Обойти уровень (0) — проверка адекватности кода. Обойти (1) — доказательство, что признаки несут информацию. Обойти (2) на дистанции — уже претензия на реальную ценность, и она требует строжайшей проверки на утечки.

Важно зафиксировать baseline до начала эксперимента и не менять его задним числом. Если выбранный конкурент оказался слишком слабым или слишком сильным — это отдельное наблюдение, а не повод молча подменить линейку.

СКИЛЛ-СКОР ОТНОСИТЕЛЬНО BASELINE



Для метрик типа Brier или log loss: положительный скилл означает, что модель лучше базовой линии; ноль — паритет; отрицательный — модель хуже тривиального правила.

Кейс: победа над слабым соперником

Исследователь обучил градиентный бустинг и получил log loss 0.94, отчитавшись об «улучшении на 3 %». Выяснилось, что базовой линией служила частота исходов домашних побед за пять сезонов (log loss 0.97). Однако котировки закрытия после удаления маржи давали на той же выборке log loss 0.90 — то есть «умная» модель проигрывала рынку 4 %. Правильный вывод из эксперимента: признаки системы на тот момент не содержали информации сверх рыночной цены. Это не провал работы — отрицательный результат надёжнее ложноположительного: он останавливает вложения в бесперспективное направление. Рабочее правило: отчёт о качестве модели всегда двухстрочный — «модель против простого baseline» и «модель против рыночного benchmark». Одной цифрой качество не описывается.

ТИПИЧНЫЕ ОШИБКИ

✗ Сравнивать модель с заведомо слабой линейкой и выдавать это за силу сигнала.

✗ Менять baseline после того, как увиден результат (rationalization).

✗ Отчитываться одной метрикой без указания, относительно кого она измерена.

ЗАДАНИЕ

Для вашей текущей задачи выпишите трёхуровневую лестницу baseline: тривиальный (частоты), средний (простой рейтинг), рыночный (devig closing price). Укажите, какую метрику будете сравнивать на каждом уровне и какой размер выборки нужен, чтобы различие в 1 % метрики было статистически различимо.

Вопросы для самопроверки

1. Зачем фиксировать baseline до начала эксперимента?

2. Опишите трёхуровневую иерархию базовых линий в спортивной аналитике.

3. Что доказывает и что не доказывает скилл-скор +3 % относительно частот исходов?

1.5. Процесс решения: от гипотезы до вывода

Профессиональный процесс — это конвейер, в котором каждый узел зафиксирован до знакомства с результатом: формулировка гипотезы → определение момента доступности данных → выбор baseline → временной разрез выборки → обучение/настройка на прошлом → единственная проверка на будущем (out-of-sample) → экономическая оценка → решение о дальнейшей судьбе сигнала. Последовательность важнее узлов: она защищает от главной профессиональной опасности — построить объяснение после известного исхода.

Дисциплина предрегистрации: гипотеза фиксируется письменно до теста вместе с условиями фальсификации («сигнал считается мёртвым, если скилл-скор против devig на 1 000 новых событий не превысит 0»). Предрегистрация превращает исследование в эксперимент: любой исход становится информативным, а не только победный.

Отдельный узел — экономика. Статистически значимый сигнал может не покрывать маржу, ограничение ликвидности (низкий максимум ставки), проскальзывание цены или операционные издержки. Поэтому экономический блок считается после статистики, но до любого практического вывода.

Кейс: гипотеза «домашний недооценённый андердог»

Предрегистрация: вселенная — домашние команды с ценой победы выше 3.50; признаки — разность xG за 10 матчей и отдых; тест — сезон-2024, обучение на 2019–2023; метрика — ROI по флэту и Brier против devig; условие провала — отрицательный скилл или ROI ниже −5 %. Тест показал ROI −2.1 % при скилл-скоре +0.4 %: слабый статистический след, но после маржи экономики нет. По заранее записанному правилу гипотеза архивируется с пометкой «неэкономично при текущей марже», и команда идёт дальше — без попыток «подкрутить» фильтры, пока цифра не станет красивой. Именно здесь процесс отличается от хобби: заранее записанное условие провала исполняется так же неукоснительно, как и условие успеха.

ТИПИЧНЫЕ ОШИБКИ

✗ Тестировать гипотезу и формулировать выводы на одной и той же выборке.

✗ Не записывать условия фальсификации — тогда гипотеза неуязвима и бесполезна.

✗ Считать статистику и экономику одним шагом: сначала правда о сигнале, потом правда о деньгах.

ЗАДАНИЕ

Возьмите одну гипотезу из своего списка и оформите карточку предрегистрации: формулировка, вселенная событий, момент доступности данных, baseline, обучающий и тестовый периоды, метрика, условие провала. Подпишите датой и сохраните в неизменяемом виде до окончания теста.

Вопросы для самопроверки

1. Перечислите узлы профессионального конвейера решения.

2. Что даёт предрегистрация и почему нельзя менять её задним числом?

3. Почему экономическая оценка идёт после статистической, а не вместо неё?

1.6. Ошибки мышления: как аналитик обманывает себя сам

Самый состоятельный аналитик проигрывает не нехватке методов, а встроенным искажениям. Hindsight bias: после известного результата история «на ходу» переписывается — закономерность кажется очевидной, хотя до матча сигналов было десятки в обе стороны. Confirmation bias: ищутся подтверждающие примеры, а контрпримеры помечаются «исключениями». Selection bias: обсуждаются стратегии, дожившие до публикации; тысячи умерших в репозитории не попадают.

Отдельная группа — статистические ловушки. Data dredging: перебор сотен правил гарантирует, что какое-то пройдёт любой порог случайно (подробнее — модуль 3). Overfitting на шуме: сложная модель идеально описывает прошлое ровно настолько, насколько бесполезна в будущем. Регрессия к среднему: «серия из пяти побед» без сигнала возвращается к среднему сама, и стратегия «покупать на подъёме» систематически покупает на пике.

Противоядие — не сила воли, а структура: предрегистрация против hindsight, обязательный список контрпримеров против confirmation, временные разрезы против утечек, поправки на множественные сравнения против перебора, post-mortem культуры — чтобы ошибки превращались в институциональную память, а не в повторяющийся налог.

Кейс: триумф подтверждения

Исследование «домашних фаворитов после поражения» собрало 40 подтверждающих примеров и выглядело убедительно. Проверка полной вселенной нашла 310 событий правила; подтверждающие примеры составили типичную хвостовую долю, а ROI полной совокупности был −6 %.



ТИПИЧНЫЕ ОШИБКИ

✗ Верить, что дисциплина заменяет методику: искажения побеждаются процедурой, а не характером.

✗ Считать сложную модель защитой от шума — она лишь находит его элегантнее.

✗ Оценивать стратегию по опубликованным историям успеха, игнорируя молчащее большинство.

ЗАДАНИЕ

Проведите ревизию своих последних десяти выводов: для каждого отметьте, какие искажения могли повлиять на формулировку, и какой структурный приём (предрегистрация, полная выгрузка, поправка на перебор) нейтрализовал бы риск. Два вывода с самым слабым обоснованием — переделать по-настоящему.

Вопросы для самопроверки

1. Чем hindsight bias отличается от простой ошибки памяти?

2. Почему перебор правил гарантированно находит «успешное»?

3. Как функция post-mortem превращает ошибку в актив команды?

Ograniczenie wiekowe:
18+
Data wydania na Litres:
14 września 2026
Data napisania:
2026
Objętość:
247 str. 80 ilustracji
Właściciel praw:
Автор
Format pobierania:

Podobne książki