Теория вероятности для спортивной аналитики

Курс даёт практическую базу по теории вероятности и статистическому мышлению, необходимую для анализа спортивных событий и показателей. Вы научитесь моделировать исходы матчей, оценивать неопределённость, работать с данными и корректно интерпретировать результаты для прогнозов и принятия решений.

Случайные события и вероятности в спорте

Случайные события и вероятности в спорте

Спортивная аналитика почти всегда начинается с вопроса «насколько вероятно, что произойдёт X?». X может быть голом, победой, попаданием в створ, тоталом больше 2.5, травмой игрока в сезоне или тем, что команда наберёт не меньше 10 очков в следующих пяти матчах.

В этой статье мы разберём базовые кирпичики теории вероятностей: случайный эксперимент, исходы, события и вероятность. Это язык, на котором дальше будут формулироваться модели, метрики и прогнозы.

Что в спорте является случайностью

Важно различать:

  • Неопределённость для наблюдателя (мы не знаем заранее исход)
  • Случайность как удобная модель (мы описываем процесс вероятностно, даже если «в реальности» всё обусловлено множеством факторов)

В спорте результат зависит от погоды, усталости, микротравм, тактики, судейских решений и множества неучтённых переменных. Поэтому вероятностная модель помогает:

  • формализовать ожидания
  • сравнивать игроков и команды честнее, чем по одному матчу
  • отделять «шум» от устойчивых тенденций

Случайный эксперимент и пространство исходов

Случайный эксперимент — это процедура с заранее определёнными правилами, результат которой заранее неизвестен.

Примеры экспериментов в спорте:

  • пробитие пенальти одним игроком
  • исход матча (победа/ничья/поражение)
  • количество угловых в матче
  • попадёт ли бросок в баскетболе с конкретной позиции

Исход — конкретный результат эксперимента.

Пространство исходов Ω\Omega — множество всех возможных исходов.

Примеры:

  • Для серии «победа/ничья/поражение»:

Ω={W,D,L}\Omega = \{W, D, L\}

Здесь Ω\Omega — «все варианты», WW (win) — победа, DD (draw) — ничья, LL (loss) — поражение.

  • Для пенальти «гол/не гол»:

Ω={G,N}\Omega = \{G, N\}

Здесь GG — гол, NN — не гол.

События: как задавать то, что нас интересует

Событие — это подмножество Ω\Omega, то есть набор исходов, который мы считаем «успехом» по определению задачи.

Примеры событий в матче с Ω={W,D,L}\Omega = \{W, D, L\}:

  • «Команда не проиграет» — событие A={W,D}A = \{W, D\}
  • «Команда выиграет» — событие B={W}B = \{W\}

Примеры событий для количества голов, если рассматриваем только 0, 1, 2, 3+:

  • Ω={0,1,2,3+}\Omega = \{0, 1, 2, 3+\}
  • «Тотал больше 1.5» — событие T={2,3+}T = \{2, 3+\}

Полезные операции над событиями

Пусть AA и BB — события.

  • Объединение ABA \cup B: произошло хотя бы одно из событий (A или B).
  • Пересечение ABA \cap B: произошли оба события одновременно (A и B).
  • Дополнение Aˉ\bar{A}: событие «A не произошло».

Пример (футбол):

  • AA = «команда забьёт хотя бы 1 гол»
  • BB = «команда не проиграет»

Тогда:

  • ABA \cap B = «команда забьёт и не проиграет»
  • Aˉ\bar{A} = «команда не забьёт»

Вероятность: что означает число P(A)P(A)

Вероятность события — число от 0 до 1, которое отражает, насколько ожидаемо событие.

Обозначение: P(A)P(A) — вероятность события AA.

Интерпретация:

  • P(A)=0P(A)=0 — событие невозможно в рамках модели
  • P(A)=1P(A)=1 — событие обязательно произойдёт в рамках модели
  • P(A)=0.7P(A)=0.7 — событие происходит «примерно в 70% подобных случаев» (в частотной интерпретации)

Базовые правила (аксиомы)

В спортивной аналитике обычно опираются на стандартные аксиомы вероятности (часто называемые аксиомами Колмогорова; формально они описаны в математических учебниках и справочниках).

  1. Для любого события AA: P(A)0P(A) \ge 0
  2. P(Ω)=1P(\Omega) = 1
  3. Если события AA и BB не могут произойти одновременно (то есть AB=A \cap B = \varnothing), то:

P(AB)=P(A)+P(B)P(A \cup B) = P(A) + P(B)

Здесь:

  • \cup означает «или»
  • \cap означает «и»
  • \varnothing — пустое множество (нет общих исходов)

Практический пример (исход матча): события «победа» и «ничья» взаимоисключающие, значит

P(WD)=P(W)+P(D)P(W \cup D) = P(W) + P(D)

А это и есть вероятность «не проиграть».

Справка: аксиомы вероятности.

Как получать вероятности в спорте

В реальных задачах спортивной аналитики вероятность почти никогда не «берётся из воздуха». Обычно используются два подхода.

Модельный (теоретический) подход

Он возможен, когда структура процесса хорошо понятна и упрощения приемлемы.

Примеры:

  • серия пенальти как независимые испытания с постоянной вероятностью гола
  • «монетка» как базовая метафора для 50/50 ситуаций (в спорте почти всегда это упрощение)

Эмпирический (частотный) подход

Вероятность оценивают по данным.

Если у нас было nn похожих ситуаций и событие AA случилось kk раз, то частотная оценка:

P^(A)=kn\hat{P}(A) = \frac{k}{n}

Здесь:

  • P^(A)\hat{P}(A) — оценка вероятности по данным
  • kk — сколько раз событие произошло
  • nn — сколько наблюдений всего

Пример: игрок бил 50 пенальти и забил 40. Тогда оценка вероятности гола:

P^(G)=4050=0.8\hat{P}(G) = \frac{40}{50} = 0.8

Важное ограничение: «похожие ситуации» — ключевая часть. Пенальти в товарищеском матче и в финале могут быть разными по контексту.

Условная вероятность: «если известно, что…»

В спорте почти всё зависит от условий: состав, счёт, домашнее поле, удаление, стадия турнира.

Условная вероятность отвечает на вопрос: какова вероятность события AA, если мы знаем, что произошло событие BB?

Обозначение: P(AB)P(A \mid B).

Формула:

P(AB)=P(AB)P(B)P(A \mid B) = \frac{P(A \cap B)}{P(B)}

Здесь:

  • P(AB)P(A \mid B) — вероятность AA при условии BB
  • ABA \cap B — событие «A и B вместе»
  • условие P(B)>0P(B) > 0 означает: нельзя «условиться» на событие с нулевой вероятностью в модели

Спортивная интерпретация:

  • AA = «команда выиграет матч»
  • BB = «команда ведёт в счёте после первого тайма»

Тогда P(AB)P(A \mid B) — вероятность победы при условии, что команда уже ведёт после 45 минут.

Независимость: когда одно не меняет другое

Два события AA и BB называются независимыми, если знание о BB не меняет вероятность AA:

P(AB)=P(A)P(A \mid B) = P(A)

Эквивалентная форма (часто удобнее):

P(AB)=P(A)P(B)P(A \cap B) = P(A)\,P(B)

Почему это важно в спорте:

  • Многие «интуитивно независимые» вещи на самом деле зависимы (например, «забили гол» и «выиграли матч»)
  • Ошибка независимости приводит к неверным оценкам вероятностей и переоценке уверенности прогнозов

Пример близкий к независимости: «выпадет ли дождь в день матча» и «сделает ли конкретный защитник ошибку в первом тайме» — могут быть зависимы через состояние поля, но часто их ошибочно считают независимыми.

Мини-словарь: как формулировать события в аналитике

Аналитическая формулировка Событие Пример пространства исходов Ω\Omega
Победа команды {W}\{W\} {W,D,L}\{W, D, L\}
Не проиграет {W,D}\{W, D\} {W,D,L}\{W, D, L\}
Обе забьют «гол хозяев» \cap «гол гостей» по голам/счёту
Тотал больше 2.5 {3,4,5,}\{3,4,5,\dots\} {0,1,2,3,4,}\{0,1,2,3,4,\dots\}
Удаление в матче «будет красная карточка» {\{да, нет}\}

Типичные ошибки новичков

  1. Путать исходы и события

    Исход — один конкретный результат, событие — набор исходов.

  2. Смешивать «вероятность» и «уверенность»

    Вероятность — часть модели. Если модель плохая (мало данных, неверные предположения), число может выглядеть точным, но быть неверным.

  3. Игнорировать условность

    P(победы)P(победы) без указания контекста часто бесполезна. Гораздо информативнее P(победысостав,счёт,дом/выезд)P(победы \mid состав, счёт, дом/выезд).

Что дальше

В следующем материале логично переходить к тому, как считать вероятности для комбинаций событий (правила сложения и умножения), а также к базовым техникам работы с данными: частотные оценки, влияние размера выборки и здравые проверки.

Условная вероятность и зависимость факторов

Условная вероятность и зависимость факторов

В предыдущей статье мы ввели язык спортивной вероятности: случайные эксперименты, пространство исходов Ω\Omega, события и базовые правила для P(A)P(A). Теперь сделаем следующий шаг: научимся корректно говорить о вероятностях в контексте — когда нам известно какое-то условие (счёт, удаление, домашнее поле, состав), и разберём, что значит зависимость факторов в данных.

Главная мысль для аналитика: одна и та же «вероятность победы» может быть совершенно разной в зависимости от того, что уже известно.

Условная вероятность: вероятность с учётом контекста

Условная вероятность отвечает на вопрос: какова вероятность события AA, если мы знаем, что произошло событие BB.

Обозначение: P(AB)P(A \mid B).

Формула:

P(AB)=P(AB)P(B)P(A \mid B) = \frac{P(A \cap B)}{P(B)}

Разберём элементы формулы:

  • AA — событие, которое хотим оценить (например, «команда выиграет матч»).
  • BB — известное условие (например, «команда ведёт после первого тайма»).
  • ABA \cap B — событие «произошли и AA, и BB».
  • P(B)P(B) — вероятность условия (важно, чтобы P(B)>0P(B) > 0, иначе «делить не на что»).

Интуитивно эта формула говорит: из всех случаев, где условие BB случилось, мы смотрим, в какой доле этих случаев также случилось AA.

Мини-пример на данных

Пусть у команды в сезоне 100 матчей.

  • В 40 матчах команда вела после первого тайма: это означает P(B)=40/100=0.4P(B)=40/100=0.4.
  • Из этих 40 матчей она выиграла 30: это означает P(AB)=30/100=0.3P(A \cap B)=30/100=0.3.

Тогда:

P(AB)=0.30.4=0.75P(A \mid B)=\frac{0.3}{0.4}=0.75

То есть вероятность победы при условии лидерства в перерыве оценивается как 75%.

Зависимость и независимость: когда контекст меняет вероятность

События AA и BB называются независимыми, если знание о BB не меняет вероятность AA:

P(AB)=P(A)P(A \mid B)=P(A)

Эквивалентная и часто удобная запись:

P(AB)=P(A)P(B)P(A \cap B)=P(A)\,P(B)

Пояснение элементов:

  • P(AB)P(A \cap B) — вероятность того, что произойдут оба события.
  • P(A)P(B)P(A)\,P(B) — что было бы, если бы события «перемножались» как независимые.

Почему в спорте независимость — редкость

В спорте почти всё связано:

  • «Команда забила первой» и «команда победила» — обычно зависимы.
  • «Удаление у соперника» и «тотал больше» — часто зависимы.
  • «Домашний матч» и «количество фолов» — может быть зависимо через стиль судейства, давление трибун и тактику.

Типичная ошибка — молча предполагать независимость и получать слишком уверенные оценки.

Правило умножения: как переходить между совместной и условной вероятностью

Из определения условной вероятности следует практичная формула:

P(AB)=P(B)P(AB)P(A \cap B)=P(B)\,P(A \mid B)

Это читается так: «вероятность BB и затем AA при условии BB».

Спортивная интерпретация:

  • BB = «команда ведёт после первого тайма»
  • AA = «команда выиграла матч»

Тогда P(AB)P(A \cap B) — вероятность сценария «ведём в перерыве и выигрываем».

Закон полной вероятности: когда контекст разбивает мир на случаи

Часто удобно разложить вероятность на несколько непересекающихся сценариев.

Пусть событие BB — «команда играла дома», а Bˉ\bar{B} — «команда играла в гостях». Эти два события:

  • покрывают все матчи (либо дома, либо в гостях)
  • не происходят одновременно

Тогда для любого события AA (например, «победа») верно:

P(A)=P(AB)P(B)+P(ABˉ)P(Bˉ)P(A)=P(A \mid B)\,P(B)+P(A \mid \bar{B})\,P(\bar{B})

Пояснение:

  • P(AB)P(A \mid B) — вероятность победы дома.
  • P(B)P(B) — доля домашних матчей.
  • P(ABˉ)P(A \mid \bar{B}) — вероятность победы в гостях.
  • P(Bˉ)P(\bar{B}) — доля гостевых матчей.

Это полезно, когда общая вероятность — это смесь разных режимов (дом/выезд, стартовый состав/ротация, наличие/отсутствие лидера).

Теорема Байеса: как переворачивать условие

В аналитике часто нужен обратный вопрос:

  • не только «какова вероятность победы, если команда ведёт?»,
  • но и «насколько вероятно, что команда вела, если она победила?»

Теорема Байеса связывает эти величины:

P(BA)=P(AB)P(B)P(A)P(B \mid A)=\frac{P(A \mid B)\,P(B)}{P(A)}

Где:

  • P(BA)P(B \mid A) — вероятность условия BB при известном исходе AA.
  • P(AB)P(A \mid B) — «прямая» условная вероятность.
  • P(B)P(B) — базовая вероятность условия.
  • P(A)P(A) — базовая вероятность исхода.

Практический смысл: Байес помогает обновлять вероятность гипотезы (например, «команда была сильнее по моментам») после наблюдения результата (например, «команда выиграла»). В спортивных данных это часто используется в рейтингах, фильтрации сигналов и моделях, где «истинная сила» скрыта.

Справка: Теорема Байеса.

Зависимость факторов в данных: что может пойти не так

Условные вероятности легко посчитать, но легко и ошибиться в интерпретации. В спорте большинство факторов взаимосвязаны, и простое сравнение «при X вероятность выше» ещё не означает, что X причина.

Смешение факторов (конфаунинг): ложный эффект

Смешивающий фактор — это переменная, которая влияет и на «причину», и на «результат», создавая иллюзию связи.

Пример логики (без формул):

  1. Команда чаще ведёт в счёте к перерыву, когда играет против слабых соперников.
  2. Против слабых соперников команда чаще побеждает.
  3. Если не учитывать силу соперника, можно переоценить «магический эффект лидерства в перерыве».

Иными словами, событие BB («ведём к перерыву») может быть не причиной победы, а маркером того, что изначально матч был легче.

Парадокс Симпсона: агрегирование может перевернуть вывод

Иногда в каждом сегменте данных связь одна, но в целом — противоположная. Это известно как парадокс Симпсона.

Справка: Парадокс Симпсона.

Спортивная интуиция:

  • В каждом типе матчей (например, «против сильных» и «против слабых») одна тактика может быть лучше.
  • Но если команда применяла эту тактику чаще именно в самых сложных матчах, то в суммарной статистике она может выглядеть хуже.

Вывод для аналитика: условные вероятности надо считать в корректных разрезах (по силе соперника, дому/выезду, составу, состоянию игрока), иначе можно получить неправильную историю.

«Корреляция не означает причинность» в вероятностной форме

Фраза «корреляция не означает причинность» в нашем языке означает: если P(AB)P(A)P(A \mid B) \ne P(A), то это показывает зависимость, но не доказывает, что BB вызывает AA.

Справка: Correlation does not imply causation.

Практика: как задавать условные вероятности в спортивной задаче

Чтобы условная вероятность работала на вас, полезно формулировать контекст как события и аккуратно задавать выборку.

Чек-лист постановки

  1. Чётко определить AA и BB в виде событий
  2. Убедиться, что BB наблюдаемо и однозначно
  3. Уточнить, что значит «похожие ситуации»
  4. Следить за размером выборки для BB

Пример формулировок

Вопрос аналитика Событие AA Условие BB Что оцениваем
Как часто команда выигрывает, если забила первой? «победа» «первый гол за нами» P(победапервый гол)P(победа \mid первый\ гол)
Как меняется шанс гола со стандарта при дожде? «гол со стандарта» «дождь» P(гол со стандартадождь)P(гол\ со\ стандарта \mid дождь)
Насколько удаление соперника влияет на победу? «победа» «удаление у соперника» сравнение P(победаудаление)P(победа \mid удаление) и P(победа)P(победа)

Что дальше

Условная вероятность — основной инструмент спортивной аналитики: почти любой матч можно описать как последовательность состояний и обновлений шансов. Дальше обычно переходят к моделированию случайных величин (голы, броски, очки), выборкам и оценкам параметров, а также к тому, как строить вероятностные модели, которые учитывают сразу несколько факторов.

Случайные величины и распределения спортивных метрик

Случайные величины и распределения спортивных метрик

В первых материалах курса мы говорили о событиях (например, «команда не проиграет») и о том, как контекст меняет шансы через условную вероятность P(AB)P(A \mid B). Следующий шаг в спортивной аналитике — перейти от «да/нет» к числам: сколько голов, сколько бросков, какой будет разрыв в счёте, сколько минут игрок проведёт на площадке.

Такие числовые показатели описывают через случайные величины и их распределения. Это базовый инструментарий для прогнозов, симуляций матчей и оценки неопределённости.

Случайная величина: число, которое получается случайно

Случайная величина XX — это правило, которое каждому исходу матча/эпизода из пространства исходов Ω\Omega ставит в соответствие число.

Примеры в спорте:

  • XX — число голов команды за матч
  • XX — число трёхочковых попаданий игрока
  • XX — время владения мячом (в процентах)
  • XX — разница в счёте (очки хозяев минус очки гостей)

Связь с предыдущими статьями:

  • событие «тотал больше 2.5» можно записать как {X3}\{X \ge 3\}, где XX — общее число голов в матче
  • условная вероятность «победа при лидерстве в перерыве» — это частный случай условного распределения: нас интересует распределение результата при условии известного состояния матча

Дискретные и непрерывные метрики

Дискретные случайные величины

Дискретная величина принимает счётные значения (обычно целые).

Примеры:

  • число голов: 0,1,2,3,0,1,2,3,\dots
  • число фолов: 0,1,2,0,1,2,\dots
  • число угловых: 0,1,2,0,1,2,\dots

Для дискретной величины задают функцию вероятностей (часто называют PMF):

P(X=k)P(X=k)

Здесь:

  • XX — случайная величина
  • kk — конкретное значение (например, k=2k=2 гола)
  • P(X=k)P(X=k) — вероятность ровно kk

Непрерывные случайные величины

Непрерывная величина принимает значения на отрезке/интервале.

Примеры:

  • скорость игрока (км/ч)
  • дистанция пробега (км)
  • время реакции (сек)
  • доля владения мячом в модели как число от 0 до 1

Для непрерывной величины вероятность «ровно одного значения» обычно равна нулю: P(X=x)=0P(X=x)=0. Вместо этого рассматривают вероятность попасть в интервал, например P(aXb)P(\,a \le X \le b\,). Для описания используют плотность вероятности (PDF) и/или функцию распределения.

Функция распределения: универсальный язык для любых XX

Функция распределения (CDF) случайной величины XX:

F(x)=P(Xx)F(x)=P(X \le x)

Где:

  • xx — порог (например, x=1.5x=1.5)
  • F(x)F(x) — вероятность, что величина не превысит порог

Почему CDF полезна в спорте:

  • легко получать вероятности формата «не меньше/не больше»
  • одинаково работает для дискретных и непрерывных метрик

Пример: пусть XX — голы команды за матч. Тогда F(1)=P(X1)F(1)=P(X\le 1) — вероятность забить 0 или 1 гол.

Математическое ожидание: «среднее» в вероятностном смысле

Математическое ожидание (expected value) — это долгосрочное среднее значение метрики, если ситуацию повторять много раз.

Обозначение: E[X]\mathbb{E}[X].

Для дискретной величины:

E[X]=kkP(X=k)\mathbb{E}[X]=\sum_{k} k\,P(X=k)

Где:

  • сумма k\sum_k берётся по всем возможным значениям kk
  • P(X=k)P(X=k) — вероятность каждого значения

Спортивная интерпретация:

  • если XX — голы команды за матч, то E[X]\mathbb{E}[X] — «ожидаемые голы» в среднем по большому числу матчей при одинаковых условиях модели

Важно: ожидание — это не гарантированный исход одного матча. Команда с E[X]=1.6\mathbb{E}[X]=1.6 часто будет забивать 1, иногда 0, иногда 3.

Дисперсия: насколько сильно метрика «шумит»

Чтобы понимать риск и неопределённость, нужна не только «середина», но и разброс.

Дисперсия:

Var(X)=E[(XE[X])2]\mathrm{Var}(X)=\mathbb{E}\big[(X-\mathbb{E}[X])^2\big]

Где:

  • XE[X]X-\mathbb{E}[X] — отклонение от среднего
  • квадрат нужен, чтобы положительные и отрицательные отклонения не сокращались

Стандартное отклонение (часто удобнее для интерпретации):

σ=Var(X)\sigma=\sqrt{\mathrm{Var}(X)}

Где σ\sigma измеряется в тех же единицах, что и XX (например, «гола»).

Практический смысл в спорте:

  • две команды могут иметь одинаковые E[X]\mathbb{E}[X] по голам, но разный разброс: одна стабильно забивает около 1–2, другая «то 0, то 4»

Типовые распределения для спортивных задач

Ниже — не «обязательные истины», а популярные приближения, которые часто хорошо работают как стартовая модель.

Бернулли: событие «да/нет» как случайная величина

Если результат эпизода бинарный (успех/неуспех), удобно ввести X{0,1}X \in \{0,1\}.

Пример:

  • X=1X=1, если пенальти забит
  • X=0X=0, если не забит

Тогда:

  • P(X=1)=pP(X=1)=p
  • P(X=0)=1pP(X=0)=1-p
  • E[X]=p\mathbb{E}[X]=p (ожидаемое значение равно вероятности успеха)

Справка: Bernoulli distribution.

Биномиальное распределение: число успехов в nn попытках

Если есть nn попыток с одинаковой вероятностью успеха pp и (в модели) независимостью, то число успехов XX часто моделируют биномиально.

Пример:

  • nn — количество штрафных бросков игрока
  • XX — сколько он забил

Вероятность ровно kk успехов:

P(X=k)=(nk)pk(1p)nkP(X=k)=\binom{n}{k} p^k (1-p)^{n-k}

Где:

  • nn — число попыток
  • kk — число успехов
  • pp — вероятность успеха в одной попытке
  • (nk)\binom{n}{k} — число способов выбрать, какие именно kk попыток стали успешными

Справка: Binomial distribution.

Ограничение в спорте: pp редко бывает «постоянным» (усталость, защита, качество моментов), поэтому биномиальная модель — часто приближение.

Пуассон: счётные события за фиксированное время

Число голов/бросков/угловых за матч часто начинают моделировать распределением Пуассона, если события:

  • считаются редкими на малых промежутках времени
  • происходят «примерно с постоянной интенсивностью»

Пусть XX — число голов команды за матч, а λ\lambda — среднее число голов (интенсивность) в рамках модели.

Тогда:

P(X=k)=λkeλk!P(X=k)=\frac{\lambda^k e^{-\lambda}}{k!}

Где:

  • kk — число голов (0,1,2,...)
  • ee — математическая константа
  • k!k! — факториал

Свойства, полезные аналитикам:

  • E[X]=λ\mathbb{E}[X]=\lambda
  • Var(X)=λ\mathrm{Var}(X)=\lambda (разброс равен среднему в базовой версии модели)

Справка: Poisson distribution.

Практическое замечание: в данных часто бывает переразброс (дисперсия больше среднего), потому что интенсивность λ\lambda меняется от матча к матчу (сила соперника, стиль, красные карточки). Это сигнал, что нужна условная модель λ(контекст)\lambda(контекст).

Нормальное приближение: метрики-«суммы»

Многие спортивные показатели — это сумма большого числа мелких вкладов:

  • очки в баскетболе — сумма результативных атак
  • дистанция пробега — сумма перемещений

В таких случаях распределение может быть близко к нормальному (колоколообразному) как приближение.

Справка: Normal distribution.

Ограничение: нормальное распределение не подходит для строго неотрицательных счётчиков (голы) и может давать «невозможные» значения (например, отрицательные).

Условные распределения: метрики зависят от контекста

В предыдущей статье мы обсуждали условную вероятность P(AB)P(A \mid B). Для случайных величин аналогичная идея звучит так: распределение XX меняется при условии BB.

Примеры:

  • XX — голы команды за матч, BB — «играем дома»
  • XX — количество бросков, BB — «у соперника красная карточка»

Тогда нас интересует не просто P(X=k)P(X=k), а P(X=kB)P(X=k \mid B).

Очень практичная форма — закон полной вероятности для дискретного XX через разбиение контекста на случаи BB и Bˉ\bar{B}:

P(X=k)=P(X=kB)P(B)+P(X=kBˉ)P(Bˉ)P(X=k)=P(X=k \mid B)\,P(B)+P(X=k \mid \bar{B})\,P(\bar{B})

Где:

  • P(B)P(B) — насколько часто встречается контекст BB (например, доля домашних матчей)
  • P(X=kB)P(X=k \mid B) — распределение метрики внутри этого контекста

Интерпретация для аналитика: «общее распределение — это смесь распределений разных режимов».

Как выбирать распределение в задаче спортивной аналитики

Практический чек-лист:

  1. Определите тип метрики
    • счётчик (0,1,2,...)
    • доля/процент (0..1)
    • непрерывная величина (скорость, время)
  2. Определите единицу наблюдения
    • матч, тайм, смена, владение, бросок
  3. Проверьте базовые эмпирические признаки
    • среднее и дисперсию (например, для Пуассона они примерно равны)
    • наличие «лишних нулей» (часто бывает в ударах в створ у отдельных игроков)
  4. Подумайте о контексте
    • если метрика явно меняется от условий, полезнее моделировать P(Xконтекст)P(X \mid контекст), чем одно общее P(X)P(X)

Таблица-ориентир:

Метрика Тип XX Частая стартовая модель Комментарий
Пенальти: гол/не гол дискретная (0/1) Бернулли E[X]=p\mathbb{E}[X]=p
Забитые штрафные из nn дискретная Биномиальная важно, насколько реалистична «одинаковость» pp
Голы за матч дискретная Пуассон часто нужно делать λ\lambda зависимой от контекста
Очки команды в баскетболе дискретная, но большая Нормальное приближение как приближение для сумм
Скорость, время реакции непрерывная зависит от данных часто сравнивают эмпирически и выбирают семейство

Что дальше

Случайные величины и распределения превращают спортивные метрики в модели, с которыми можно работать: считать ожидания, доверительные интервалы, делать симуляции и обновлять прогнозы по ходу матча. В следующих шагах курса обычно переходят к оцениванию параметров распределений по данным и к моделям, которые учитывают сразу несколько факторов (то есть строят распределения вида P(Xпризнаки)P(X \mid признаки)).

Математическое ожидание, дисперсия и риск

Математическое ожидание, дисперсия и риск

В прошлой статье мы ввели случайные величины XX (например, голы за матч) и распределения P(X=k)P(X=k) или F(x)=P(Xx)F(x)=P(X\le x). Теперь разберём три понятия, без которых спортивная аналитика быстро превращается в набор «средних по больнице»:

  • математическое ожидание: что мы в среднем получим на длинной дистанции;
  • дисперсия (и стандартное отклонение): насколько результат «шумит» вокруг среднего;
  • риск: как этот шум превращается в неприятные сценарии (провалы, апсеты, проигрыши ставок, нестабильность формы).

Ключевая идея: две команды/игрока могут иметь одинаковое «среднее», но совершенно разную вероятность провальных матчей.

Математическое ожидание: «среднее на дистанции»

Математическое ожидание случайной величины XX обозначают E[X]\mathbb{E}[X] и читают как «ожидаемое значение XX».

Если XX дискретна (например, голы за матч), то

E[X]=kkP(X=k)\mathbb{E}[X]=\sum_{k} k\,P(X=k)

Где:

  • XX — метрика (например, голы команды за матч).
  • kk — возможное значение метрики (0,1,2,0,1,2,\dots).
  • P(X=k)P(X=k) — вероятность ровно kk.
  • k\sum_k — суммирование по всем значениям, которые может принимать XX.

Интерпретация в спорте: если многократно «проигрывать» матч в одинаковых условиях модели, то среднее число голов будет стремиться к E[X]\mathbb{E}[X].

Почему ожидание — не прогноз счёта

Если E[X]=1.6\mathbb{E}[X]=1.6, это не означает «скорее всего будет 1.6 гола». Это означает:

  • 0–1 гол может случаться часто;
  • 3–4 гола — реже;
  • но на длинной дистанции среднее будет около 1.6.

То есть ожидание — это центр распределения, а не самый вероятный исход.

Ожидание как основа решений

Ожидание удобно, когда вы выбираете между альтернативами.

Пример (пенальти как Бернулли): пусть X{0,1}X\in\{0,1\}, где X=1X=1 если гол, и X=0X=0 если нет. Тогда

  • P(X=1)=pP(X=1)=p — вероятность забить;
  • P(X=0)=1pP(X=0)=1-p.

Подставим в формулу ожидания:

E[X]=1p+0(1p)=p\mathbb{E}[X] = 1\cdot p + 0\cdot (1-p)=p

То есть для «да/нет» ожидание равно вероятности успеха.

Если же вы оцениваете «ценность» действия в очках/победе/деньгах, ожидание превращается в ожидаемую полезность: результат умножается на «цену» и усредняется.

Линейность ожидания: важнейшее свойство для спортивных сумм

Очень часто метрика — сумма многих вкладов: очки = очки за владения, броски = броски за отрезки, голы = голы по таймам.

Если XX и YY — любые случайные величины, то

E[X+Y]=E[X]+E[Y]\mathbb{E}[X+Y]=\mathbb{E}[X]+\mathbb{E}[Y]

Где:

  • X+YX+Y — суммарная метрика (например, голы в 1-м тайме + голы во 2-м).
  • E[X]\mathbb{E}[X] и E[Y]\mathbb{E}[Y] — средние по компонентам.

Важно: это верно даже если XX и YY зависимы. Для аналитика это означает, что ожидания удобно складывать почти всегда.

Справка: Математическое ожидание.

Дисперсия и стандартное отклонение: «насколько нестабильно»

Если ожидание отвечает за «центр», то дисперсия отвечает за «разброс» результатов.

Дисперсия обозначается Var(X)\mathrm{Var}(X) и определяется так:

Var(X)=E[(XE[X])2]\mathrm{Var}(X)=\mathbb{E}\big[(X-\mathbb{E}[X])^2\big]

Разберём, что здесь означает каждый кусок:

  • XX — наблюдаемое значение метрики (например, голы в конкретном матче).
  • E[X]\mathbb{E}[X] — среднее значение метрики.
  • XE[X]X-\mathbb{E}[X] — отклонение от среднего.
  • ()2(\cdot)^2 — квадрат отклонения (чтобы минусы не сокращали плюсы и сильные отклонения штрафовались сильнее).
  • E[    ]\mathbb{E}[\;\cdot\;] — «усреднение» этих квадратов отклонений.

Поскольку дисперсия измеряется в «квадратных единицах» (например, «гол^2»), часто используют стандартное отклонение:

σ=Var(X)\sigma=\sqrt{\mathrm{Var}(X)}

Где σ\sigma измеряется в тех же единицах, что и XX (например, «голы»).

Справка: Дисперсия случайной величины, Стандартное отклонение.

Две команды с одинаковым средним, но разной дисперсией

Представьте две команды, у которых E[X]\mathbb{E}[X] по голам одинаковое.

  • Команда A чаще играет «ровно на свой уровень» (много матчей 1–2 гола).
  • Команда B «качает» (то 0, то 3–4).

У них может быть одинаковое ожидание, но у B будет выше дисперсия и выше риск провалов.

Связь с моделями из прошлой статьи

В статье про распределения мы обсуждали Пуассона как стартовую модель для голов: у неё часто E[X]=λ\mathbb{E}[X]=\lambda и Var(X)=λ\mathrm{Var}(X)=\lambda. В реальных данных дисперсия нередко больше среднего (переразброс) из-за меняющегося контекста: сила соперника, красные карточки, стиль игры. Это прямой сигнал, что «одна λ\lambda на все матчи» — слишком грубо, и нужно моделировать условно: λ(контекст)\lambda(\text{контекст}).

Риск в спортивной аналитике: что именно мы боимся

Слово риск в спортивных задачах обычно означает не абстрактный «разброс», а вероятность и тяжесть нежелательных сценариев.

Чаще всего риск проявляется так:

  • риск провала: P(Xt)P(X\le t) для неприятного порога tt (например, «забьём 0»);
  • риск апсета: вероятность проиграть матч, где по ожиданиям вы сильнее;
  • риск тотала: вероятность недобора/перебора относительно линии;
  • риск нестабильности игрока: высокая дисперсия формы означает больше матчей «ниже ожиданий»;
  • риск ошибки вывода: маленькая выборка даёт нестабильные оценки среднего и дисперсии.

Почему нельзя смотреть только на среднее

Два игрока могут иметь одинаковые 15 очков в среднем:

  • один стабильно даёт 13–17;
  • второй то 5, то 30.

Для тренера это разные профили риска:

  • в плей-офф может быть ценнее стабильность (низкий риск провала);
  • андердогу может быть выгодна «качка», потому что апсет часто требует «верхнего хвоста» распределения.

Риск как выбор метрики под задачу

Одна и та же дисперсия может быть «плохой» или «хорошей» в зависимости от цели.

  • Если задача — минимизировать вероятность поражения в равном матче, часто ценится меньшая дисперсия.
  • Если задача — максимизировать шанс апсета против фаворита, иногда полезна большая дисперсия (больше шансов попасть в «выдающийся матч»).

Как оценивать ожидание и дисперсию по данным

В практике у вас есть выборка значений x1,,xnx_1,\dots,x_n (например, голы команды в nn матчах при похожем контексте).

Выборочное среднее

xˉ=1ni=1nxi\bar{x}=\frac{1}{n}\sum_{i=1}^{n} x_i

Где:

  • nn — число матчей/наблюдений.
  • xix_i — значение метрики в ii-м матче.
  • i=1n\sum_{i=1}^{n} — сумма по всем матчам.
  • xˉ\bar{x} — оценка ожидания E[X]\mathbb{E}[X].

Выборочная дисперсия

Часто используют оценку

s2=1n1i=1n(xixˉ)2 s^2=\frac{1}{n-1}\sum_{i=1}^{n} (x_i-\bar{x})^2

Где:

  • s2s^2 — оценка дисперсии.
  • (xixˉ)(x_i-\bar{x}) — отклонение конкретного матча от среднего.
  • деление на n1n-1 (а не на nn) применяется как стандартная поправка, чтобы дисперсия не занижалась на малых выборках.

Практические замечания для спорта

  • Старайтесь считать xˉ\bar{x} и s2s^2 в корректном контексте: дома/выезд, сила соперника, состав. Это напрямую связано с условными вероятностями из прошлой статьи.
  • На малых выборках разброс оценок очень высок: «10 матчей» редко достаточно для уверенных выводов о дисперсии.

Типичные ошибки

  • Путать «высокое ожидание» с «низким риском»: высокий E[X]\mathbb{E}[X] не гарантирует малую вероятность провала.
  • Сравнивать игроков по среднему, игнорируя роль и контекст (например, игрок со скамейки и стартер).
  • Делать выводы о стабильности по коротким сериям: визуально кажется, что «поплыл», но это может быть нормальный шум при высокой дисперсии.

Что дальше

Ожидание и дисперсия — это базовые числа, которые связывают распределение метрики с решениями и риском. Следующий практический шаг — научиться:

  • строить вероятности событий вроде P(Xt)P(X\ge t) и P(победа)P(\text{победа}) из распределений;
  • делать условные оценки E[Xконтекст]\mathbb{E}[X\mid \text{контекст}] и Var(Xконтекст)\mathrm{Var}(X\mid \text{контекст});
  • использовать эти величины в моделях прогнозирования и симуляциях матчей.

Выборка, оценки и доверительные интервалы

Выборка, оценки и доверительные интервалы

В предыдущих статьях курса мы обсуждали, как задавать события и вероятности, как учитывать контекст через условную вероятность, и как описывать спортивные метрики как случайные величины с распределениями. Теперь добавим ключевой мост между моделью и данными: как по наблюдениям (матчам, эпизодам, сезонам) получать численные оценки вероятностей и средних значений, и насколько этим оценкам можно доверять.

Эта статья про три практических инструмента спортивного аналитика:

  • выборка — какие данные мы считаали и почему это важно
  • оценка — какое число мы получили (например, вероятность гола или среднее число бросков)
  • доверительный интервал — диапазон, который показывает неопределённость оценки из-за конечного числа наблюдений

Генеральная совокупность и выборка

Генеральная совокупность — это «все случаи, которые нас интересуют», даже если мы их не наблюдаем целиком.

Примеры в спорте:

  • все пенальти, которые игрок мог бы пробить в будущем при похожих условиях
  • все матчи команды в сезоне против соперников определённого уровня
  • все броски игрока из конкретной зоны площадки

Выборка — реально наблюдённые случаи из этой совокупности.

Важно: в спорте выборка почти всегда неидеальна.

  • Матчи отличаются по контексту (дом/выезд, состав, усталость).
  • Данные часто зависимы во времени (форма, травмы, календарь).
  • Есть смещение из-за отбора (например, «игрок бросает только когда открыт»).

Справка: Выборка (статистика).

Что такое оценка параметра

Обычно мы хотим узнать параметр — неизвестную характеристику процесса.

Примеры параметров:

  • pp — вероятность, что пенальти будет забит
  • μ\mu — истинное среднее число голов команды за матч в данном контексте
  • λ\lambda — интенсивность голов в пуассоновской модели

Оценка — число, которое мы вычисляем по выборке, чтобы приблизить параметр.

Частотная оценка вероятности

Если событие AA случилось kk раз из nn наблюдений, то частотная оценка вероятности:

p^=kn\hat{p}=\frac{k}{n}

Где:

  • nn — число наблюдений (например, число пенальти)
  • kk — сколько раз событие произошло (например, сколько пенальти забито)
  • p^\hat{p} — оценка вероятности pp по данным

Это ровно то, что мы уже использовали интуитивно в ранних статьях, когда обсуждали «сколько раз из nn».

Оценка среднего значения метрики

Если у нас есть значения метрики x1,,xnx_1,\dots,x_n (например, голы в каждом матче), то выборочное среднее:

xˉ=1ni=1nxi\bar{x}=\frac{1}{n}\sum_{i=1}^{n}x_i

Где:

  • xix_i — значение метрики в ii-м наблюдении
  • nn — размер выборки
  • i=1nxi\sum_{i=1}^{n}x_i — сумма всех значений
  • xˉ\bar{x} — оценка математического ожидания μ=E[X]\mu=\mathbb{E}[X] в данном контексте

Почему оценки «шумят»: идея выборочного распределения

Даже если истинная вероятность гола с пенальти равна pp, ваша оценка p^\hat{p} будет разной на разных наборах из nn пенальти. Это не ошибка вычислений, а нормальная неопределённость из-за конечной выборки.

Мысленный эксперимент:

  • берём 50 пенальти игрока и считаем p^\hat{p}
  • повторяем это много раз на других «похожих» 50 пенальти
  • получаем распределение оценок p^\hat{p}

Это распределение называют выборочным распределением оценки.

Стандартная ошибка: «типичный» размер ошибки оценки

Чтобы перейти от идеи «оценка шумит» к числам, используют стандартную ошибку.

Для среднего значения

Сначала вводят выборочное стандартное отклонение ss (мы уже видели похожую формулу в статье про дисперсию как оценку разброса по данным):

s=1n1i=1n(xixˉ)2 s=\sqrt{\frac{1}{n-1}\sum_{i=1}^{n}(x_i-\bar{x})^2}

Где:

  • xixˉx_i-\bar{x} — отклонение наблюдения от среднего
  • квадрат нужен, чтобы отклонения не сокращались
  • деление на n1n-1 — стандартная поправка для оценки разброса по выборке

Тогда стандартная ошибка среднего:

SE(xˉ)=snSE(\bar{x})=\frac{s}{\sqrt{n}}

Где:

  • SE(xˉ)SE(\bar{x}) — насколько в среднем может «плавать» оценка среднего из-за конечного nn
  • n\sqrt{n} — корень из размера выборки: рост nn уменьшает неопределённость примерно как 1/n1/\sqrt{n}

Для доли (вероятности) в бинарном событии

Если мы оцениваем вероятность события через долю p^=k/n\hat{p}=k/n, то часто используют приближение стандартной ошибки:

SE(p^)p^(1p^)nSE(\hat{p})\approx\sqrt{\frac{\hat{p}(1-\hat{p})}{n}}

Где p^(1p^)\hat{p}(1-\hat{p}) — оценка дисперсии бинарной величины (успех/неуспех), а nn — размер выборки.

Важно: это приближение хуже работает при малых nn и при вероятностях, близких к 0 или 1.

Доверительный интервал: диапазон правдоподобных значений параметра

Доверительный интервал — это диапазон, который описывает неопределённость оценки.

Частая форма: оценка ±\pm «погрешность».

Например, для среднего (в простом приближении):

xˉ±1.96SE(xˉ)\bar{x} \pm 1.96\cdot SE(\bar{x})

Где:

  • xˉ\bar{x} — оценка среднего
  • SE(xˉ)SE(\bar{x}) — стандартная ошибка
  • число 1.961.96 соответствует примерно 95% покрытию в нормальном приближении

Смысл числа 1.96: если оценка ведёт себя примерно как нормальная случайная величина, то около 95% массы нормального распределения лежит в пределах примерно ±1.96\pm 1.96 стандартных отклонений.

Справки:

Как правильно интерпретировать 95% доверительный интервал

Нужно аккуратно с интерпретацией.

Правильная частотная интерпретация:

  • Если мы много раз повторим процедуру построения интервала на новых выборках такого же размера и качества, то примерно в 95% случаев интервал будет содержать истинный параметр.

Неправильная, но распространённая интерпретация:

  • «Вероятность, что истинный параметр лежит в этом конкретном интервале, равна 95%».

Почему это считается неправильным в классической статистике: параметр фиксирован (просто неизвестен), а случайным является интервал, который меняется от выборки к выборке.

Практические доверительные интервалы в спортивных задачах

Интервал для доли: пример с пенальти

Игрок забил k=40k=40 из n=50n=50 пенальти. Тогда p^=0.8\hat{p}=0.8.

Сначала оценим стандартную ошибку:

SE(p^)0.80.250SE(\hat{p})\approx\sqrt{\frac{0.8\cdot 0.2}{50}}

Здесь:

  • 0.80.20.8\cdot 0.2 — оценка разброса бинарного исхода при p^=0.8\hat{p}=0.8
  • деление на 5050 означает, что больше наблюдений уменьшает неопределённость

Приближённый 95% интервал:

p^±1.96SE(p^)\hat{p} \pm 1.96\cdot SE(\hat{p})

Практический вывод: даже при p^=0.8\hat{p}=0.8 интервал может быть довольно широким на n=50n=50, а на n=10n=10 будет ещё шире.

Важно: для долей при малых выборках часто используют более устойчивые интервалы (например, интервал Уилсона), потому что простое приближение может давать странные границы и переоценивать уверенность.

Интервал для среднего: пример с бросками в створ

Пусть XX — броски в створ команды за матч. Мы собрали n=20n=20 матчей в похожем контексте (например, против соперников из середины таблицы), получили:

  • xˉ=5.1\bar{x}=5.1
  • s=1.8s=1.8

Тогда:

SE(xˉ)=1.820SE(\bar{x})=\frac{1.8}{\sqrt{20}}

И приближённый 95% интервал:

5.1±1.96SE(xˉ)5.1 \pm 1.96\cdot SE(\bar{x})

Смысл: мы не только говорим «в среднем 5.1», но и показываем, насколько это число неопределённо при n=20n=20.

Бутстрэп: доверительный интервал без сложных формул

В спортивной аналитике часто бывает сложно честно выписать формулу для стандартной ошибки:

  • метрика не нормальная
  • выборка маленькая
  • есть выбросы
  • распределение сильно асимметрично

Тогда помогает бутстрэп: компьютерный способ оценить неопределённость.

Идея простая:

  1. У вас есть выборка из nn матчей.
  2. Вы много раз создаёте «новую выборку» размера nn, случайно выбирая матчи с возвращением из исходной выборки.
  3. Для каждой такой псевдовыборки считаете нужную статистику (например, среднее или долю побед).
  4. Получаете распределение этой статистики и берёте, например, 2.5-й и 97.5-й процентили как 95% интервал.

Справка: Бутстрэп (статистика).

Что чаще всего ломает выводы в спортивных данных

Ниже — причины, почему интервал может выглядеть «научно», но быть обманчивым.

Наблюдения не независимы

Многие формулы стандартных ошибок предполагают независимость наблюдений. В спорте это часто нарушено:

  • серия матчей с одинаковыми травмами и ротацией
  • календарь (несколько игр за короткий срок)
  • психологические и тактические эффекты по ходу сезона

Практическое следствие: реальная неопределённость может быть больше, чем показывает «классический» интервал.

Выборка не соответствует вопросу

Если вы хотите оценить P(голпозиционная атака)P(гол\mid позиционная\ атака), а считаете по всем атакам вместе, вы получаете смесь контекстов (ровно то, о чём мы говорили в статье про условную вероятность и закон полной вероятности).

Смещение из-за отбора

Примеры:

  • игрок бросает только в удобных ситуациях, поэтому «процент» выше, чем был бы при большем объёме и более сложных бросках
  • команда чаще выходит вперёд в матчах против слабых соперников, поэтому условные оценки «если ведём — мы выигрываем» могут быть завышены без учёта силы соперника

Это не проблема доверительного интервала как инструмента, это проблема постановки: интервал честно описывает неопределённость внутри выбранных данных, но не гарантирует переносимость на другие условия.

Мини-чек-лист для аналитика

  • Чётко сформулируйте параметр: вероятность чего именно, среднее чего именно, при каком контексте.
  • Убедитесь, что выборка соответствует контексту (или используйте условные оценки).
  • Всегда фиксируйте nn рядом с оценкой.
  • Для маленьких выборок и нестандартных метрик рассмотрите бутстрэп.
  • Интерпретируйте доверительный интервал как свойство процедуры, а не как «вероятность для числа».

Что дальше

Доверительные интервалы и стандартные ошибки завершают базовый цикл: события и вероятностиусловные вероятностираспределения метриксреднее/дисперсияоценивание по выборке с неопределённостью.

Следующий практический шаг спортивной аналитики — использовать эти идеи в моделях прогнозирования: строить E[Xпризнаки]\mathbb{E}[X\mid признаки] и P(событиепризнаки)P(событие\mid признаки), сравнивать модели по качеству и не путать «точность на истории» с реальной предсказательной силой.

Проверка гипотез и сравнение игроков и команд

Проверка гипотез и сравнение игроков и команд

В прошлой статье мы научились оценивать вероятности и средние по данным и добавлять к ним неопределённость через стандартные ошибки и доверительные интервалы. Но в спортивной аналитике часто звучит следующий вопрос:

  • игрок A действительно лучше игрока B, или разница случайна?
  • команда стала сильнее после смены тренера, или это просто удачный отрезок?
  • новая тактика увеличила количество моментов, или мы видим шум?

Проверка статистических гипотез превращает такие вопросы в формальную процедуру принятия решения с контролируемым риском ошибки.

Что такое гипотеза в спортивной задаче

В терминах курса у нас есть неизвестный параметр (или несколько), который описывает процесс:

  • pp — вероятность забить пенальти
  • μ\mu — среднее число бросков в створ за матч
  • Δ\Delta — разница средних между двумя игроками или режимами

Мы наблюдаем выборку и получаем оценку (p^\hat{p}, xˉ\bar{x}), но она шумит из-за конечного числа наблюдений.

Гипотеза — это утверждение о параметре, которое мы хотим проверить.

Обычно формулируют две гипотезы:

  • Нулевая гипотеза H0H_0: эффекта нет или разницы нет.
  • Альтернативная гипотеза H1H_1: эффект есть.

Примеры:

  • H0H_0: у двух игроков одинаковая вероятность забить пенальти
  • H1H_1: вероятности отличаются

Важно: проверка гипотез не доказывает, что H0H_0 истинна или ложна навсегда. Это процедура, которая говорит, насколько наблюдаемые данные совместимы с H0H_0.

Справка: Статистическая проверка гипотез.

Логика проверки гипотез: что именно мы сравниваем

Процедура почти всегда устроена одинаково:

  1. Вы задаёте H0H_0 и H1H_1.
  2. Вы выбираете статистику теста — число, которое измеряет величину эффекта в данных.
  3. Вы понимаете, как эта статистика ведёт себя, если H0H_0 верна.
  4. Вы вычисляете, насколько “экстремально” ваше наблюдение при H0H_0.

Ключевой термин здесь — p-value.

p-value: что это и чего это не означает

p-value — это вероятность получить наблюдение не менее экстремальное, чем ваше, при условии, что H0H_0 верна.

То есть p-value — это про P(данныеH0)P(\text{данные} \mid H_0), а не про P(H0данные)P(H_0 \mid \text{данные}).

Типичные ошибки интерпретации:

  • Неправильно: “p-value = 0.03 означает, что вероятность того, что разницы нет, равна 3%”.
  • Правильно: “если бы разницы не было, такие (или ещё более сильные) данные встречались бы примерно в 3% случаев”.

Справка: p-value.

Уровень значимости и ошибки решений

Чтобы превратить p-value в решение, заранее выбирают уровень значимости α\alpha (часто 0.05).

  • если p-value α\le \alpha, говорят, что результат статистически значим, и отвергают H0H_0
  • если p-value >α> \alpha, H0H_0 не отвергают

При этом возможны два типа ошибок:

  • Ошибка первого рода: отвергли H0H_0, хотя она верна (ложноположительный вывод). Её вероятность и контролируется уровнем α\alpha.
  • Ошибка второго рода: не отвергли H0H_0, хотя на самом деле эффект есть (ложноотрицательный вывод).

Также важна мощность теста: вероятность обнаружить эффект, если он существует. На мощность сильно влияют размер выборки и величина реального эффекта.

Сравнение долей: “у кого выше вероятность успеха”

Очень частая спортивная задача: сравнить две вероятности успеха.

Пример:

  • игрок A забил k1k_1 пенальти из n1n_1
  • игрок B забил k2k_2 пенальти из n2n_2

Оценки вероятностей:

  • p^1=k1/n1\hat{p}_1 = k_1 / n_1
  • p^2=k2/n2\hat{p}_2 = k_2 / n_2

Идея теста для разности долей

Нулевая гипотеза часто выглядит так:

  • H0:p1=p2H_0: p_1 = p_2

Тогда в рамках H0H_0 можно оценить “общую” вероятность успеха, используя объединённые данные:

p^=k1+k2n1+n2\hat{p} = \frac{k_1 + k_2}{n_1 + n_2}

Где:

  • k1,k2k_1, k_2 — число успехов у игрока A и B
  • n1,n2n_1, n_2 — число попыток
  • p^\hat{p} — общая доля успеха, если предположить, что вероятности одинаковы

Дальше считается статистика (часто её обозначают zz), которая сравнивает разницу p^1p^2\hat{p}_1 - \hat{p}_2 с типичным “шумом” этой разницы при H0H_0:

z=p^1p^2p^(1p^)(1n1+1n2)z = \frac{\hat{p}_1 - \hat{p}_2}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}}

Пояснение элементов:

  • числитель p^1p^2\hat{p}_1 - \hat{p}_2 — наблюдаемая разница
  • выражение под корнем — оценка стандартного отклонения разницы долей при H0H_0
  • 1/n11/n_1 и 1/n21/n_2 отражают простой факт: чем больше попыток, тем стабильнее оценка

Далее по значению zz получают p-value (например, для “двусторонней” проверки, когда интересует любое отличие, и в плюс, и в минус).

Практическая оговорка: при малых выборках для долей часто используют точные методы, например Точный критерий Фишера.

Сравнение средних: “кто набирает больше в среднем”

Если метрика числовая (очки, xG за матч, передачи под удар), часто сравнивают средние значения.

Пример:

  • XX — очки игрока за матч
  • есть выборки матчей игрока A и игрока B

t-тест для независимых выборок

Одна из стандартных процедур — t-тест. Его базовая идея: сравнить разницу средних с ожидаемым уровнем шума.

Одна из популярных форм (особенно в варианте Уэлча, когда дисперсии могут отличаться) использует статистику:

t=xˉ1xˉ2s12n1+s22n2t = \frac{\bar{x}_1 - \bar{x}_2}{\sqrt{\frac{s_1^2}{n_1} + \frac{s_2^2}{n_2}}}

Пояснение элементов:

  • xˉ1,xˉ2\bar{x}_1, \bar{x}_2 — выборочные средние для двух игроков/команд
  • s12,s22s_1^2, s_2^2 — выборочные дисперсии (оценки разброса)
  • n1,n2n_1, n_2 — размеры выборок
  • знаменатель — оценка стандартной ошибки разницы средних

Если t|t| слишком велик для того, что обычно бывает при H0H_0, p-value становится маленьким.

Парные сравнения: когда важна “сопоставимость” матчей

Во многих спортивных задачах наблюдения логично сравнивать парами, чтобы убрать шум контекста.

Примеры:

  • команда “до” и “после” смены тренера, но сравниваем матчи против соперников похожей силы
  • один и тот же игрок “до” и “после” изменения роли, сравнение по одинаковым типам соперников

Тогда вместо двух независимых выборок анализируют разности внутри пар:

  • di=xi,послеxi,доd_i = x_{i,\text{после}} - x_{i,\text{до}}

И проверяют, отличается ли средняя разность от нуля.

Идея: парный подход уменьшает дисперсию “внешних факторов”, потому что сравнение происходит внутри более похожих ситуаций.

Табличные данные: “связаны ли два фактора”

Иногда метрика — не число и не доля успехов, а таблица частот. Например:

  • результат матча (победа/ничья/поражение)
  • признак (дом/выезд)

Тогда вопрос: зависит ли распределение исходов от признака?

Для таких задач часто используют Критерий хи-квадрат.

Статистика обычно имеет вид:

χ2=i,j(OijEij)2Eij\chi^2 = \sum_{i,j} \frac{(O_{ij}-E_{ij})^2}{E_{ij}}

Пояснение элементов:

  • OijO_{ij} — наблюдаемое число матчей в ячейке таблицы (например, “победа дома”)
  • EijE_{ij} — ожидаемое число матчей в ячейке, если зависимости нет (если H0H_0 верна)
  • сумма идёт по всем ячейкам таблицы

Если расхождения между наблюдаемыми и ожидаемыми частотами слишком велики, χ2\chi^2 становится большим, p-value уменьшается.

Доверительные интервалы и проверки гипотез: практическая связь

Доверительный интервал из прошлой статьи часто даёт более полезную картину, чем “значимо/не значимо”.

  • проверка гипотез отвечает: можно ли отвергнуть ноль?
  • доверительный интервал отвечает: какие размеры эффекта вообще правдоподобны по данным?

Практическое правило (для многих стандартных тестов):

  • если 95% доверительный интервал для разницы не содержит 0, то при α=0.05\alpha=0.05 вы обычно отвергнете H0H_0 о нулевой разнице

Это помогает не терять “размер эффекта” за бинарным решением.

Размер эффекта: статистическая значимость против спортивного смысла

На больших данных можно получить маленькое p-value даже для микроскопической разницы.

Поэтому в спортивной аналитике важно разделять:

  • статистическую значимость: маловероятно получить такие данные при H0H_0
  • практическую значимость: разница достаточно велика, чтобы менять решения

Один из способов говорить о размере эффекта при сравнении средних — стандартизировать разницу через разброс. Например, Cohen’s d:

d=xˉ1xˉ2spd = \frac{\bar{x}_1 - \bar{x}_2}{s_p}

Где:

  • xˉ1xˉ2\bar{x}_1 - \bar{x}_2 — разница средних
  • sps_p — “типичный” масштаб разброса (объединённая оценка стандартного отклонения)

Справка: Effect size.

Множественные сравнения: ловушка “мы нашли 3 значимых игрока из 50”

Если вы сравниваете много игроков, позиций или метрик, то вы неизбежно найдёте “значимые” различия просто по случайности.

Пример логики:

  • вы сделали 100 независимых проверок при α=0.05\alpha=0.05
  • даже если везде H0H_0 верна, вы ожидаете около 5 ложноположительных “находок”

Один из простых способов контроля — поправка Бонферрони: если вы делаете mm тестов, используйте уровень

α=αm\alpha' = \frac{\alpha}{m}

Где:

  • α\alpha — желаемый общий риск ложноположительных выводов
  • mm — число проверок
  • α\alpha' — порог для каждого отдельного теста

Справка: Поправка Бонферрони.

Альтернатива, часто полезная в аналитике больших наборов показателей, — контроль доли ложных открытий (FDR): False discovery rate.

Когда классические тесты дают сбой

В спорте особенно часто ломаются предпосылки “учебной статистики”:

  • наблюдения зависимы во времени (форма, травмы, календарь)
  • выборки нерепрезентативны (отбор ситуаций)
  • распределения асимметричны и с выбросами

В таких случаях полезны вычислительные подходы.

Перестановочный тест: проверка без жёстких предположений

Идея: если H0H_0 верна и “разницы нет”, то метки “игрок A” и “игрок B” можно случайно перемешивать, и статистика разницы будет вести себя похоже.

Процедура часто выглядит так:

  1. Вы выбираете статистику эффекта, например Δ=xˉ1xˉ2\Delta = \bar{x}_1 - \bar{x}_2.
  2. Считаете наблюдаемое Δobs\Delta_{obs}.
  3. Много раз перемешиваете метки принадлежности наблюдений к группам.
  4. Каждый раз пересчитываете Δ\Delta и получаете “нулевое” распределение.
  5. p-value оцениваете как долю перестановок, где эффект не менее экстремален, чем Δobs\Delta_{obs}.

Этот подход близок по духу к бутстрэпу из прошлой статьи, но отвечает именно на вопрос гипотезы.

Справка: Permutation test.

Рабочий чек-лист: как сравнивать игроков и команды аккуратно

  1. Чётко сформулировать эффект
    • разница долей? разница средних? зависимость факторов в таблице?
  2. Зафиксировать контекст
    • дом/выезд, сила соперника, минуты на площадке, роль игрока
  3. Выбрать тест и убедиться, что он подходит
    • для долей: тест разности долей или точные методы
    • для средних: t-тест (часто Уэлча) или парный вариант
    • для таблиц: хи-квадрат или точные методы
  4. Всегда добавлять оценку размера эффекта и доверительный интервал
  5. Если сравнений много — учитывать множественные проверки
  6. Интерпретировать результат как поддержку решения, а не как “математическое доказательство”

Что дальше

Проверка гипотез завершает базовый цикл курса: от вероятностей и условных вероятностей к распределениям, оценкам, доверительным интервалам и решениям на данных.

Дальше логично переходить к моделям, которые учитывают сразу несколько факторов и дают прогнозы вида P(победапризнаки)P(\text{победа} \mid \text{признаки}) или E[Xпризнаки]\mathbb{E}[X \mid \text{признаки}], а также к сравнению качества таких моделей на данных.

Вероятностные модели матчей и прогнозирование исходов

Вероятностные модели матчей и прогнозирование исходов

В предыдущих статьях курса мы научились формулировать спортивные задачи через события и вероятности, учитывать контекст с помощью условной вероятности, описывать метрики как случайные величины с распределениями, оценивать параметры по выборке и проверять гипотезы.

Теперь соберём всё в прикладной инструмент спортивной аналитики: вероятностную модель матча, которая выдаёт не одно предсказание «кто победит», а распределение вероятностей по исходам и счёту.

Главная идея: хороший прогноз в спорте — это правильные вероятности, а не только «угаданный результат». Команда может проиграть матч, который выигрывает в 70% симуляций, и это не будет противоречием.

Что такое вероятностная модель матча

Вероятностная модель матча — это способ описать неопределённый исход через вероятности.

В зависимости от цели модель может выдавать:

  • P(W)P(W), P(D)P(D), P(L)P(L) — вероятности победы, ничьи и поражения
  • вероятности рынков: P(ТБ 2.5)P(\text{ТБ 2.5}), P(обе забьют)P(\text{обе забьют})
  • распределение счёта: P(счёт i ⁣: ⁣j)P(\text{счёт } i\!:\!j)

Почему это важно:

  • вероятности позволяют сравнивать решения по ожиданию и риску (связь со статьёй про E[X]\mathbb{E}[X] и Var(X)\mathrm{Var}(X))
  • вероятности можно обновлять по ходу матча как условные (связь с P(AB)P(A\mid B))
  • вероятностные прогнозы можно оценивать по качеству (а не только по «проценту угаданных»)

Моделирование счёта через распределение Пуассона

Для футбола и других видов спорта с редкими результативными событиями стартовая точка — моделировать число голов (или шайб) как распределение Пуассона.

Пусть:

  • XhX_h — голы хозяев
  • XaX_a — голы гостей
  • λh\lambda_h — среднее число голов хозяев в модели
  • λa\lambda_a — среднее число голов гостей в модели

Тогда базовая идея:

  • XhPois(λh)X_h \sim \text{Pois}(\lambda_h)
  • XaPois(λa)X_a \sim \text{Pois}(\lambda_a)

Где запись XPois(λ)X \sim \text{Pois}(\lambda) означает: «случайная величина XX имеет пуассоновское распределение с параметром λ\lambda». В этой модели λ\lambda одновременно задаёт и среднее, и дисперсию: E[X]=λ\mathbb{E}[X]=\lambda и Var(X)=λ\mathrm{Var}(X)=\lambda.

Справка: Распределение Пуассона.

Как из λ\lambda получить вероятность конкретного числа голов

В пуассоновской модели вероятность того, что команда забьёт ровно kk голов, равна:

P(X=k)=λkeλk!P(X=k)=\frac{\lambda^k e^{-\lambda}}{k!}

Где:

  • kk — число голов (0, 1, 2, ...)
  • λ\lambda — среднее число голов по модели
  • ee — математическая константа
  • k!k! — факториал (произведение чисел от 1 до kk)

Вероятность счёта и вероятности W/D/L

Если дополнительно принять, что XhX_h и XaX_a независимы, то вероятность точного счёта i ⁣: ⁣ji\!:\!j равна:

P(Xh=i,Xa=j)=P(Xh=i)P(Xa=j)P(X_h=i,\,X_a=j)=P(X_h=i)\,P(X_a=j)

Где:

  • ii — голы хозяев
  • jj — голы гостей
  • независимость означает, что совместная вероятность раскладывается в произведение

Дальше вероятности исходов выражаются суммированием вероятностей счётов:

  • P(W)=i>jP(Xh=i,Xa=j)P(W)=\sum_{i>j} P(X_h=i,\,X_a=j)
  • P(D)=i=jP(Xh=i,Xa=j)P(D)=\sum_{i=j} P(X_h=i,\,X_a=j)
  • P(L)=i<jP(Xh=i,Xa=j)P(L)=\sum_{i<j} P(X_h=i,\,X_a=j)

Здесь суммы идут по всем целым ii и jj, но на практике их считают по разумному диапазону (например, 0–7), потому что вероятности больших значений обычно малы.

Откуда берутся λh\lambda_h и λa\lambda_a

Самый важный практический вопрос — как задать интенсивности λh\lambda_h и λa\lambda_a.

Обычно их делают функцией контекста:

  • сила атаки команды
  • сила обороны соперника
  • домашнее преимущество
  • кадровые потери
  • темп и стиль (если есть данные)

Один из стандартных способов — моделировать логарифм интенсивности линейно:

log(λh)=β0+βhome+AhomeDaway\log(\lambda_h)=\beta_0 + \beta_{\text{home}} + A_{\text{home}} - D_{\text{away}}

Где:

  • log(λh)\log(\lambda_h) — логарифм ожидаемых голов хозяев
  • β0\beta_0 — общий базовый уровень результативности лиги
  • βhome\beta_{\text{home}} — поправка на домашнее поле
  • AhomeA_{\text{home}} — параметр силы атаки хозяев
  • DawayD_{\text{away}} — параметр силы обороны гостей

Почему берут логарифм:

  • λ\lambda должна быть положительной
  • через логарифм удобно получать модель вида «база + эффекты», а затем возвращаться к λ\lambda через экспоненту: λh=exp()\lambda_h=\exp(\cdot)

Это пример того, как в одной модели встречаются темы курса:

  • распределение (Пуассон)
  • условность (интенсивность зависит от признаков)
  • оценивание параметров (β\beta, AA, DD) по данным

Ограничения пуассоновского подхода

В реальных данных часто нарушаются предпосылки базовой модели.

  • Переразброс: дисперсия голов может быть больше среднего из-за меняющегося контекста
  • Зависимость голов команд: красная карточка, сценарий матча и риск в концовке связывают XhX_h и XaX_a
  • Смещение из-за стиля: одни команды «закрывают» матч при 1:0, другие продолжают атаковать

Это не означает, что Пуассон «плох», но означает, что это стартовая модель, которую уточняют:

  • условными λ(контекст)\lambda(\text{контекст})
  • моделями зависимости (например, бивариантный Пуассон)
  • поправками под специфику футбола

Моделирование исхода напрямую: вероятности W/D/L без счёта

Иногда вам не нужен счёт, а нужна вероятность события напрямую:

  • победа команды
  • «не проиграет»
  • проход в следующий раунд

Тогда строят модель для вероятности события как функции признаков.

Логистическая регрессия для бинарного события

Пусть:

  • Y{0,1}Y\in\{0,1\} — индикатор события (например, Y=1Y=1 если команда выиграла)
  • xx — набор признаков (дом/выезд, рейтинг, травмы, rest days)

Тогда модель может задавать вероятность победы так:

P(Y=1x)=11+ezP(Y=1\mid x)=\frac{1}{1+e^{-z}}

Где:

  • z=β0+β1x1++βmxmz=\beta_0+\beta_1 x_1+\dots+\beta_m x_m
  • β0\beta_0 — свободный член
  • βi\beta_i — веса признаков
  • ee — математическая константа

Дробь 11+ez\frac{1}{1+e^{-z}} называется логистической функцией: она всегда даёт число от 0 до 1, то есть корректную вероятность.

Справка: Логистическая регрессия.

Модель на три исхода

Для W/D/LW/D/L используют обобщение на несколько классов (мультиномиальная логистическая регрессия). Практический смысл тот же: модель выдаёт три вероятности, которые суммируются в 1:

P(Wx)+P(Dx)+P(Lx)=1P(W\mid x)+P(D\mid x)+P(L\mid x)=1

Чем этот подход отличается от пуассоновского:

  • пуассоновский подход моделирует механику счёта и из него выводит исход
  • модель исхода напрямую может быть проще и устойчивее, но даёт меньше деталей (например, тоталы и точные счёта получаются хуже)

Прогнозирование по ходу матча как условная вероятность

Матч можно рассматривать как последовательность состояний. Это прямое продолжение темы условной вероятности: нас интересует вероятность исхода при условии текущей информации.

Примеры условий:

  • текущее время tt
  • текущий счёт ss
  • красные карточки
  • текущие xG или опасные атаки

Идея записывается так:

  • вместо P(W)P(W) работаем с P(Wсостояние)P(W\mid \text{состояние})

На практике часто моделируют вероятность оставшихся голов на оставшееся время, меняя λ\lambda в зависимости от состояния:

  • при красной карточке интенсивности атак меняются
  • при преимуществе в счёте команда может снижать темп

Это способ сделать модель «контекстной» и тем самым снизить ошибки из-за смешения факторов.

Оценивание параметров модели: связь с выборкой и неопределённостью

Любая вероятностная модель имеет параметры:

  • λ\lambda или параметры для λ(признаки)\lambda(\text{признаки})
  • веса β\beta в логистической регрессии

Их оценивают по историческим данным. На практике чаще всего используют максимизацию правдоподобия: выбирают параметры, при которых наблюдённые результаты наиболее вероятны.

Важно помнить из прошлых статей:

  • оценки параметров «шумят» из-за конечной выборки
  • доверительные интервалы и бутстрэп помогают оценить неопределённость
  • проверка гипотез отвечает на вопрос «похоже ли, что эффект не нулевой», но для прогноза важнее стабильность на новых данных

Как оценивать качество вероятностных прогнозов

Процент «угаданных побед» плохо подходит для вероятностей, потому что он:

  • не отличает прогноз 0.51 от 0.99
  • не наказывает за чрезмерную уверенность

Нужны метрики, которые оценивают именно качество вероятностей.

Логарифмическая потеря

Для бинарного события (победа/не победа) вводят:

  • y{0,1}y\in\{0,1\} — факт
  • pp — предсказанная вероятность события (0<p<10<p<1)

Тогда логарифмическая потеря (log loss) равна:

LogLoss=(ylog(p)+(1y)log(1p))\text{LogLoss} = -\big(y\log(p) + (1-y)\log(1-p)\big)

Пояснение:

  • если событие произошло (y=1y=1), штрафуется маленький pp через log(p)-\log(p)
  • если событие не произошло (y=0y=0), штрафуется большой pp через log(1p)-\log(1-p)
  • модель, которая часто «уверенно ошибается», получает большой штраф

Справка: Log loss.

Квадратичная потеря вероятностей (Brier score)

Для бинарного события:

Brier=(py)2\text{Brier}=(p-y)^2

Где:

  • pp — прогноз вероятности
  • yy — факт (0 или 1)

Это простой способ оценить, насколько вероятности близки к реальности.

Справка: Brier score.

Калибровка: соответствуют ли вероятности реальности

Даже если модель неплохо ранжирует матчи, она может быть плохо калибрована.

Пример плохой калибровки:

  • модель часто говорит 0.80 на победу
  • но реально такие матчи выигрываются только в 65% случаев

Калибровку проверяют графиком: группируют прогнозы по диапазонам и сравнивают прогнозируемую вероятность с фактической долей.

Практический чек-лист: как построить модель матча в аналитике

  1. Определите, что вы прогнозируете: исход, счёт, тотал, «обе забьют»

  2. Зафиксируйте единицу наблюдения и контекст: матч, тайм, отрезок, составы

  3. Выберите семейство модели:

    • Пуассон, если нужна модель счёта и производных рынков
    • логистическая модель, если нужен исход напрямую
  4. Разделите данные на обучение и проверку (или используйте кросс-валидацию)

  5. Оценивайте качество вероятностей метриками вроде LogLoss и Brier score и обязательно смотрите калибровку

  6. Всегда держите в голове неопределённость оценок и переносимость: модель, сильная на одном сезоне и лиге, может просесть на другом контексте

Что дальше

Вероятностные модели матчей — это точка, где теория вероятностей становится инструментом принятия решений:

  • через распределения и ожидания вы получаете прогнозы и риски
  • через условные вероятности обновляете прогноз по ходу игры
  • через статистические оценки и проверку гипотез понимаете, насколько данные поддерживают выводы

Дальше обычно развивают два направления:

  • более богатые модели, которые учитывают больше факторов и зависимостей
  • симуляции матчей и сезонов, где распределения превращаются в прогнозы турнирных таблиц и вероятности достижения целей