Случайные величины и их характеристики: от теории к жизненным решениям

Курс знакомит с фундаментальными понятиями теории вероятностей простым языком без избыточного академизма. На наглядных жизненных примерах вы разберётесь в дискретных и непрерывных величинах, а также научитесь находить их ключевые числовые показатели — математическое ожидание и дисперсию. Эти знания помогут объективно оценивать риски и принимать взвешенные решения в условиях неопределённости.

Случайная величина: переход от событий к числам

Случайная величина: переход от событий к числам

Представьте, что вы открыли кофейню. Каждое утро начинается с неопределенности: пойдет ли дождь, придет ли постоянный гость за большим латте, сломается ли кофемолка, опоздает ли бариста. На языке классической теории вероятностей всё это — качественные события. Вы можете аккуратно записать исходы: «пошел дождь и бариста опоздал» или «светит солнце, пришло 150 человек». Но как на основе этих словесных описаний рассчитать запас молока на неделю, составить финансовый план или оценить риски банкротства? Словесные описания нельзя сложить, от них нельзя взять среднее или вычислить процент отклонения.

Человечеству потребовался не один век, чтобы сделать решающий шаг: перестать работать с «историями» о случайностях и превратить их в числа. Мостом между хаотичным миром реальных событий и точным аппаратом математики служит фундаментальное понятие — случайная величина.

От словесных исходов к пространству возможностей

Чтобы управлять случайностью, сначала нужно очертить границы того, что вообще может произойти. Любое действие с непредсказуемым результатом математики называют случайным экспериментом. Это может быть подбрасывание монеты, бросок игрального кубика, замер времени ожидания курьера или день работы той самой кофейни.

Каждый неделимый, конкретный результат такого эксперимента называется элементарным исходом. Традиционно один элементарный исход обозначают строчной греческой буквой ω\omega (омега). Если вы бросаете стандартный шестигранный кубик, элементарный исход — это выпадение конкретной грани: ω1=1\omega_1 = 1, ω2=2\omega_2 = 2 и так далее.

Если же вы наблюдаете за погодой в течение одного часа, элементарным исходом может быть пара параметров: температура воздуха и факт наличия осадков. Главное свойство элементарного исхода: в результате одного опыта происходит ровно один исход ω\omega, и они взаимно исключают друг друга.

Множество абсолютно всех возможных элементарных исходов образует пространство элементарных исходов, которое обозначают заглавной греческой буквой Ω\Omega.

Эксперимент Элементарный исход (ω\omega) Пространство исходов (Ω\Omega)
Бросок двух монет подряд Последовательность сторон: (Орел, Решка) {(О, О), (О, Р), (Р, О), (Р, Р)}
Контроль качества детали на заводе Вердикт: «брак» или «норма» {брак, норма}
Ожидание лифта на первом этаже Точное время в секундах до открытия дверей Все действительные числа от 0 до некоторого максимума: [0,Tmax][0, T_{\max}]

В классической вероятности мы объединяли эти исходы в группы и называли их событиями. Например, событие AA — «при двух бросках монеты орел выпал хотя бы один раз». Этому событию благоприятствуют исходы {(О, О), (О, Р), (Р, О)}.

Работать с множествами удобно, пока сценариев мало. Но как только реальность усложняется, оперировать списками текстовых исходов становится невозможно. Если курьер доставляет 10 заказов, общее число комбинаций успешных и неуспешных доставок равно 210=10242^{10} = 1024. Пытаться описать экономику сервиса доставки через перечисление этих сотен текстовых цепочек бессмысленно. Нужен инструмент, который переведет эти сценарии на язык чисел.

Случайная величина — это не число, а функция

Вопреки школьной интуиции, в названии «случайная величина» кроется историческое недоразумение. Случайная величина — это не переменная вроде привычного xx из уравнений, которая прямо сейчас случайным образом меняет свое значение.

Случайная величина — это правило (закон, функция), которое сопоставляет каждому элементарному исходу эксперимента вполне определенное действительное число.

— Андрей Колмогоров, «Основные понятия теории вероятностей»

Математически случайная величина XX записывается как функция:

X:ΩRX: \Omega \to \mathbb{R}

Здесь Ω\Omega — пространство элементарных исходов (мир реальных событий), а R\mathbb{R} — числовая прямая (мир математики).

Если произошел исход ω\omega, то случайная величина принимает значение X(ω)X(\omega). До проведения эксперимента мы не знаем, какой именно исход ω\omega случится, поэтому значение величины остается неизвестным. Но само правило XX абсолютно детерминировано, прозрачно и неизменно.

Вернемся к примеру с броском двух монет. Пространство исходов:

Ω={(О,О),(О,Р),(Р,О),(Р,Р)}\Omega = \{(\text{О}, \text{О}), (\text{О}, \text{Р}), (\text{Р}, \text{О}), (\text{Р}, \text{Р})\}

Зададим случайную величину XX — «число выпавших орлов». Это правило переводит каждый качественный исход в число:

  • исходу (О,О)(\text{О}, \text{О}) функция сопоставляет число 2: X(О,О)=2X(\text{О}, \text{О}) = 2;
  • исходу (О,Р)(\text{О}, \text{Р}) сопоставляет число 1: X(О,Р)=1X(\text{О}, \text{Р}) = 1;
  • исходу (Р,О)(\text{Р}, \text{О}) сопоставляет число 1: X(Р,О)=1X(\text{Р}, \text{О}) = 1;
  • исходу (Р,Р)(\text{Р}, \text{Р}) сопоставляет число 0: X(Р,Р)=0X(\text{Р}, \text{Р}) = 0.

Обратите внимание: исходы (О,Р)(\text{О}, \text{Р}) и (Р,О)(\text{Р}, \text{О}) физически различны (в первом случае орел выпал первым, во втором — вторым), но случайная величина склеивает их в одно и то же число 1, потому что с точки зрения задачи нам важен лишь суммарный результат. Случайная величина работает как смысловой фильтр: она отсекает несущественные детали физического мира и оставляет только числовую суть.

Одно пространство исходов — бесконечно много величин

Критически важно понимать: на одном и том же пространстве элементарных исходов Ω\Omega можно построить сколько угодно разных случайных величин. Всё зависит от того, какой практический вопрос вас интересует.

Представьте медицинскую клинику, куда на плановый скрининг пришел пациент. Элементарный исход ω\omega — это комплексное состояние организма конкретного человека со всеми его индивидуальными параметрами. Каждое лабораторное измерение порождает отдельную случайную величину:

  • X(ω)X(\omega) — уровень сахара в крови натощак (в ммоль/л);
  • Y(ω)Y(\omega) — систолическое артериальное давление (в мм рт. ст.);
  • Z(ω)Z(\omega) — индекс массы тела (кг/м²);
  • W(ω)W(\omega) — бинарный индикатор: 1, если выявлены противопоказания к препарату, и 0, если противопоказаний нет.

Все эти величины действуют на одном и том же человеке (исходе ω\omega), но извлекают из него разные числовые срезы.

Рассмотрим еще одну прикладную ситуацию: вы играете с другом в кости. Правила таковы: бросаются два кубика. Если сумма очков больше 8, друг платит вам 300 RUB. Если сумма равна 7 или 8, никто никому не платит. Если сумма меньше 7, вы платите другу 200 RUB.

Исход эксперимента ω\omega — это упорядоченная пара чисел (i,j)(i, j), где i,j{1,2,3,4,5,6}i, j \in \{1, 2, 3, 4, 5, 6\}. Всего исходов 6×6=366 \times 6 = 36.

На этом множестве исходов можно задать несколько полезных случайных величин:

  1. S(ω)=i+jS(\omega) = i + j — сумма выпавших очков (принимает значения от 2 до 12).
  2. M(ω)=max(i,j)M(\omega) = \max(i, j) — максимальное из двух выпавших чисел (принимает значения от 1 до 6).
  3. V(ω)V(\omega) — ваш чистый финансовый выигрыш в рублях.

Величина VV принимает всего три значения: +300+300, 00 или 200-200. Она устроена так:

V(ω)={300,если i+j>80,если i+j{7,8}200,если i+j<7V(\omega) = \begin{cases} 300, & \text{если } i + j > 8 \\ 0, & \text{если } i + j \in \{7, 8\} \\ -200, & \text{если } i + j < 7 \end{cases}

Если выпала пара (6,4)(6, 4), то S=10S = 10, а V=+300V = +300. Если выпала пара (2,3)(2, 3), то S=5S = 5, а V=200V = -200. Мы перешли от физических граней костей к главному для игрока вопросу — изменению баланса кошелька.

Исторический контекст: как математики навели порядок

До первой трети XX века теория вероятностей оставалась скорее сборником хитроумных задач об азартных играх, стрельбе по мишеням и страховых выплатах, чем строгой математической дисциплиной. Каждая новая задача требовала своих интуитивных допущений, а формулировка «случайная величина принимает случайные значения» смущала строгих математиков своей тавтологичностью.

Портрет Андрея Николаевича Колмогорова

Прорыв произошел в 1933 году, когда выдающийся советский математик Андрей Николаевич Колмогоров опубликовал монографию «Основные понятия теории вероятностей» (Grundbegriffe der Wahrscheinlichkeitsrechnung).

Колмогоров построил строгую аксиоматику вероятностей на базе теории меры и теории функций действительного переменного. Именно он показал, что случайная величина — это обыкновенная измеримая функция, заданная на пространстве элементарных событий.

Это открытие сняло с теории вероятностей налет мистики: случайность оказалась заключена исключительно в аргументе функции (какой именно ω\omega выпадет), в то время как сама зависимость X(ω)X(\omega) подчиняется стандартным, жестким законам анализа. Как только случайная величина была строго определена как функция, математики получили право применять к ней весь накопленный арсенал: интегрировать, дифференцировать, искать пределы и оптимизировать.

Зачем нам этот переход?

Замена событий числами радикально меняет возможности анализа. Когда мы работаем с событиями, нам доступны только логические операции: «событие AA произошло ИЛИ событие BB произошло», «событие AA НЕ произошло». Мы не можем вычислить «среднее событие» между дождем и ясной погодой.

Когда события превращаются в случайные величины, перед нами открывается мир арифметики и математического анализа:

  1. Арифметические операции над случайностями. Если XX — выручка кофейни от продажи напитков за день, а YY — выручка от продажи выпечки, то общая выручка — это новая случайная величина Z=X+YZ = X + Y. Если CC — суточные расходы на аренду и сырье, то чистая прибыль выражается формулой Π=X+YC\Pi = X + Y - C. Мы можем складывать, вычитать, умножать случайные величины и делить их.
  2. Сравнение и упорядочивание. События «сломался станок» и «заболел оператор» несравнимы напрямую. Но случайные величины финансовых потерь от этих событий легко сравнить: убыток L1L_1 против убытка L2L_2. Мы сразу видим, какой риск критичнее для бизнеса.
  3. Обобщающие числовые метрики. Вместо удержания в голове всей сложной картины распределения вероятностей мы сможем сжимать информацию до компактных параметров: где находится центр распределения (математическое ожидание) и насколько велик разброс возможных значений вокруг этого центра (дисперсия и стандартное отклонение).

Дискретные и непрерывные величины: первый взгляд

В зависимости от структуры множества значений, которые может принимать случайная величина, их разделяют на два фундаментальных класса:

  • Дискретные случайные величины. Принимают изолированные, разделенные между собой значения, которые можно пересчитать (их конечное число или счетное множество). Примеры: количество звонков в службу поддержки за час (0, 1, 2, 3...), число бракованных микросхем в партии, результат броска игрального кубика.
  • Непрерывные случайные величины. Могут принимать абсолютно любое значение из некоторого непрерывного числового промежутка (или нескольких интервалов). Примеры: точное время работы ноутбука от одного заряда батареи, погрешность в диаметре изготовленного подшипника, температура кофе в момент подачи.

Способы математического описания этих двух классов заметно различаются: для дискретных величин мы можем составить таблицу и приписать каждому отдельному числу его точную вероятность, тогда как вероятность попадания непрерывной величины в одну конкретную точку всегда равна нулю (ведь на числовом отрезке бесконечно много точек). Подробное знакомство с дискретными величинами и таблицами их распределения ждет нас уже в следующей главе курса, а непрерывным величинам и функции плотности вероятности будет целиком посвящена третья глава.

Главный вывод этой вводной главы прост: случайная величина — это переводчик. Она берет многоликую, плохо поддающуюся расчетам неопределенность окружающего мира и переводит ее в координаты числовой оси, где начинают работать строгие правила математики.

Дискретные величины и ряд распределения

Дискретные величины и ряд распределения

Представьте, что вы управляете курьерской службой и готовитесь к вечерней смене. Число заказов, поступивших за последний час, может равняться 0, 1, 2, 3 или 4. Знания одних лишь возможных исходов недостаточно для закупки бензина и вызова сотрудников. Если четыре заказа приходят раз в год, а два заказа — в девяти случаях из десяти, рабочий график строится совершенно иначе, чем при равных шансах каждого исхода.

Переход от абстрактных событий к числам, который мы разобрали ранее, даёт случайную величину. Однако само число ещё «немо»: чтобы оно стало инструментом анализа и прогнозирования, каждому его значению необходимо сопоставить вероятность появления.

Дискретная природа: изолированные точки на числовой прямой

Случайная величина называется дискретной, если множество её возможных значений конечно или счётно (то есть все значения можно пронумеровать натуральными числами: первое, второе, третье...).

Главная интуиция здесь — отсутствие непрерывных переходов. Между двумя соседними значениями дискретной величины всегда есть «пустота» — интервал чисел, которые величина принять в принципе не способна.

  • Количество клиентов, зашедших в отделение банка за час (0,1,2,0, 1, 2, \dots).
  • Число забитых мячей в футбольном матче (0,1,2,3,0, 1, 2, 3, \dots). Нельзя забить 1.7 мяча.
  • Сумма очков на гранях двух игральных костей (2,3,4,,122, 3, 4, \dots, 12).

В противоположность непрерывным величинам (таким как масса яблока или время ожидания автобуса, принимающим любые дробные значения в интервале), дискретные величины представляют собой отдельные островки вероятностной массы на числовой прямой.

Ряд распределения: паспорт случайной величины

Как полностью описать поведение дискретной случайной величины? Для этого недостаточно перечислить её значения. Нужен универсальный закон, связывающий эти значения с шансами их появления.

Закон распределения дискретной случайной величины — это любое правило, устанавливающее однозначное соответствие между возможными значениями случайной величины и вероятностями, с которыми эти значения принимаются.

Самая наглядная и базовая форма такого закона — ряд распределения (его также называют таблицей распределения). Если случайная величина XX может принимать значения x1,x2,,xnx_1, x_2, \dots, x_n с соответствующими вероятностями p1,p2,,pnp_1, p_2, \dots, p_n, то ряд распределения записывается в виде таблицы из двух строк:

Значения XX (xix_i) x1x_1 x2x_2 \dots xnx_n
Вероятности (pip_i) p1p_1 p2p_2 \dots pnp_n

Здесь краткая запись pip_i обозначает вероятность того, что случайная величина XX примет конкретное числовое значение xix_i:

pi=P(X=xi)p_i = P(X = x_i)

где PP — классическая функция вероятности, XX — сама случайная величина, а xix_i — её фиксированное числовое значение.

Условие нормировки

В ряду распределения заключено фундаментальное математическое ограничение, вытекающее из аксиом вероятности:

i=1npi=p1+p2++pn=1\sum_{i=1}^n p_i = p_1 + p_2 + \dots + p_n = 1

где nn — общее количество взаимоисключающих значений случайной величины, а pip_i — вероятность каждого отдельного значения.

Смысл условия нормировки прозрачен: при проведении эксперимента случайная величина гарантированно (со 100%-й вероятностью) примет одно из предусмотренных значений. События {X=x1},{X=x2},,{X=xn}\{X = x_1\}, \{X = x_2\}, \dots, \{X = x_n\} образуют полную группу: они несовместны (величина не может одновременно быть равна 2 и 3) и исчерпывают всё пространство исходов.

Если сумма вероятностей во второй строке таблицы меньше единицы — вы упустили часть исходов. Если больше — нарушена аксиоматика несовместности.

Практический пример: подача трёх заявок на грант

Разберём, как строится ряд распределения в реальной ситуации.

Представьте стартап, который отправляет заявки на участие в трёх независимых грантовых конкурсах. Вероятность выиграть в первом конкурсе составляет 0.50.5, во втором — 0.40.4, в третьем — 0.20.2. Определим дискретную случайную величину XX как общее число выигранных грантов.

Значения, которые может принять XX, очевидны: 0,1,20, 1, 2 или 33. Найдём вероятности каждого сценария, используя правила умножения вероятностей независимых событий и сложения несовместных исходов:

  1. Ни одного гранта (X=0X = 0): стартап проиграл во всех трёх конкурсах. Вероятности поражений: 10.5=0.51 - 0.5 = 0.5, 10.4=0.61 - 0.4 = 0.6, 10.2=0.81 - 0.2 = 0.8.

    P(X=0)=0.5×0.6×0.8=0.24P(X = 0) = 0.5 \times 0.6 \times 0.8 = 0.24

  2. Ровно один грант (X=1X = 1): возможны три несовместные комбинации (выигран 1-й, но проиграны 2-й и 3-й; выигран 2-й; выигран 3-й):

    P(X=1)=(0.5×0.6×0.8)+(0.5×0.4×0.8)+(0.5×0.6×0.2)P(X = 1) = (0.5 \times 0.6 \times 0.8) + (0.5 \times 0.4 \times 0.8) + (0.5 \times 0.6 \times 0.2)

    P(X=1)=0.24+0.16+0.06=0.46P(X = 1) = 0.24 + 0.16 + 0.06 = 0.46

  3. Ровно два гранта (X=2X = 2): вновь три комбинации (проигран только 3-й, только 2-й или только 1-й):

    P(X=2)=(0.5×0.4×0.8)+(0.5×0.6×0.2)+(0.5×0.4×0.2)P(X = 2) = (0.5 \times 0.4 \times 0.8) + (0.5 \times 0.6 \times 0.2) + (0.5 \times 0.4 \times 0.2)

    P(X=2)=0.16+0.06+0.04=0.26P(X = 2) = 0.16 + 0.06 + 0.04 = 0.26

  4. Все три гранта (X=3X = 3): победа во всех трёх заявках.

    P(X=3)=0.5×0.4×0.2=0.04P(X = 3) = 0.5 \times 0.4 \times 0.2 = 0.04

Соберём результаты в единый ряд распределения:

Число побед (xix_i) 0 1 2 3
Вероятность (pip_i) 0.240.24 0.460.46 0.260.26 0.040.04

Проверим нормировку: 0.24+0.46+0.26+0.04=1.000.24 + 0.46 + 0.26 + 0.04 = 1.00. Баланс соблюдён: перед нами исчерпывающий математический профиль успешности грантовой кампании.

Графическое представление: полигон распределения

Числовые таблицы не всегда позволяют сразу схватить форму распределения: где сосредоточена основная масса вероятности, насколько распределение симметрично и как быстро затухают его «хвосты».

Для визуализации ряда распределения строят полигон распределения (многоугольник распределения). Это двумерный график в декартовой системе координат:

  • На горизонтальной оси откладываются изолированные значения случайной величины xix_i.
  • На вертикальной оси откладываются вероятности pip_i.
  • В точках с координатами (xi,pi)(x_i, p_i) ставятся маркеры, которые затем последовательно соединяются прямолинейными отрезками.

Полигон наглядно показывает вершину (моду распределения) — значение, обладающее наибольшей вероятностью реализации. В нашем примере с грантами полигон достигает пика в точке x=1x = 1 (p=0.46p = 0.46), резко спадая к x=3x = 3.

Вероятности диапазонов и накопление шансов

Часто на практике нас интересует не точечное совпадение (X=2X = 2), а попадание величины в определённый диапазон: «удастся ли выиграть хотя бы один грант?», «будет ли получено не более двух штрафов?».

Для дискретных величин вероятность попадания в интервал рассчитывается непосредственным суммированием вероятностей изолированных точек, лежащих внутри этого интервала.

Например, для нашего примера событие «получен хотя бы один грант» соответствует неравенству X1X \geq 1. Оно объединяет исходы X=1X = 1, X=2X = 2 и X=3X = 3:

P(X1)=P(X=1)+P(X=2)+P(X=3)=0.46+0.26+0.04=0.76P(X \geq 1) = P(X = 1) + P(X = 2) + P(X = 3) = 0.46 + 0.26 + 0.04 = 0.76

Тот же результат можно получить через вероятность противоположного события (ни одного гранта):

P(X1)=1P(X=0)=10.24=0.76P(X \geq 1) = 1 - P(X = 0) = 1 - 0.24 = 0.76

Это правило подводит нас к фундаментальной концепции накопления вероятностей.

Функция распределения (кумулятивная функция распределения) F(x)F(x) определяет вероятность того, что случайная величина XX примет значение, строго меньшее или равное заданному числу xx:

F(x)=P(Xx)F(x) = P(X \leq x)

Для дискретной величины график F(x)F(x) представляет собой разрывную ступенчатую лестницу, идущую слева направо от 0 до 1. Каждый раз, когда текущая точка xx пересекает допустимое значение xix_i, значение функции совершает скачок вверх ровно на величину вероятности pip_i. В промежутках между соседними значениями функция остаётся строго горизонтальной константой.

Ряд распределения и полигон дают исчерпывающую картину для любой дискретной величины: они показывают и доступные исходы, и их веса. Однако в реальном мире многие величины не делятся на штуки и счётные порции. Когда результат измерения может оказаться любым действительным числом — скажем, время ожидания курьера может составить 14 минут, 14.3 секунды или 14.3005 секунды, — табличный подход наталкивается на непреодолимое математическое препятствие. Для таких величин вероятность принять каждое конкретное число оказывается равной нулю, и привычный ряд распределения сменяется концепцией плотности вероятности.

Непрерывные величины и плотность вероятности

Непрерывные величины и плотность вероятности

Представьте, что вы заказали такси и приложение сообщает: «Водитель приедет через 5–10 минут». Какова вероятность того, что машина остановится у вашего подъезда ровно через 7 минут? Не приблизительно, а абсолютно точно: через 7 минут, 00 секунд, 000 миллисекунд, 000 микросекунд и так далее в бесконечный ряд нулей после запятой?

Математический ответ звучит обескураживающе: эта вероятность в точности равна нулю. Но ведь водитель точно приедет в какой-то момент времени! Как возможно событие, вероятность каждого отдельного момента которого равна нулю?

Этот парадокс открывает дверь в мир непрерывных случайных величин — величин, которые нельзя пересчитать по пальцам или представить в виде конечной таблицы, как мы делали с выигрышем по грантам или бросками кубиков.

Несчётный континуум: почему привычная таблица больше не работает

Когда мы работали с дискретными случайными величинами, каждому изолированному исходу xix_i соответствовала вполне осязаемая вероятность pip_i. Сумма этих вероятностей послушно давала единицу: pi=1\sum p_i = 1.

Однако время ожидания курьера, температура воздуха за окном, вес яблока или точная скорость автомобиля устроены принципиально иначе. Между любыми двумя моментами времени — скажем, 7 минутами и 8 минутами — лежит бесконечно много других моментов. Даже между 7.0001 и 7.0002 секунды скрывается несчётное количество промежуточных мгновений.

Попытаемся применить дискретный подход к измерению времени ожидания TT на отрезке от 0 до 10 минут:

  1. Если мы припишем каждому моменту хотя бы крошечную вероятность (например, 0,0000010{,}000001), то бесконечная сумма таких вероятностей мгновенно устремится в бесконечность, нарушив базовое условие нормировки.
  2. Если же вероятность каждого момента сделать равной нулю, то как тогда набрать суммарную единицу?

Решение парадокса заключается в смене оптики: в непрерывном мире вероятностью обладают не изолированные точки, а числовые промежутки (интервалы).

В непрерывном распределении вероятность попасть в любое наперёд заданное точечное значение равна нулю: P(X=c)=0P(X = c) = 0. Вероятность обретает ненулевое значение только тогда, когда мы рассматриваем интервал ненулевой длины: P(aXb)P(a \leq X \leq b).

Равенство P(X=c)=0P(X = c) = 0 не означает, что значение cc невозможно физически. Оно означает лишь то, что среди бесконечного континуума альтернатив шанс попасть ровно в идеальную математическую точку бесконечно мал. Поэтому в непрерывном анализе нет никакой разницы между строгими и нестрогими неравенствами:

P(a<X<b)=P(aXb)P(a < X < b) = P(a \leq X \leq b)

От гистограммы к плавной кривой

Как же тогда описывать шансы непрерывной величины, если привычный ряд распределения составить невозможно?

Представьте, что служба доставки анализирует время опоздания курьеров (в минутах). Аналитики берут массив из 10 000 заказов и строят гистограмму частот:

  • Сначала они разбивают время на грубые интервалы шириной в 5 минут (0–5, 5–10, 10–15). Получаются широкие столбцы. Высота каждого столбца показывает долю заказов, попавших в диапазон.
  • Затем интервалы сужают до 1 минуты. Столбцов становится больше, их вершины образуют более дробный ступенчатый профиль.
  • Если устремить ширину интервала Δx\Delta x к нулю, а количество наблюдений — к бесконечности, ступенчатая верхушка гистограммы сгладится в непрерывную линию.

Эта предельная плавная кривая называется функцией плотности вероятности (probability density function, или PDF) и обозначается как f(x)f(x).

Плотность вероятности: геометрический смысл

Слово «плотность» здесь взято из физики не случайно. Вспомните: масса неоднородного стержня в одной конкретной геометрической точке равна нулю. Чтобы получить массу, нужно умножить линейную плотность на длину отрезка (или проинтегрировать плотность по длине).

Точно так же устроена и вероятность:

Функция плотности вероятности f(x)f(x) — это функция, интеграл от которой по любому интервалу [a,b][a, b] равен вероятности того, что непрерывная случайная величина примет значение из этого интервала.

Математически это выражается через определенный интеграл:

P(aXb)=abf(x)dxP(a \leq X \leq b) = \int_{a}^{b} f(x)\,dx

Геометрически вероятность попадания случайной величины XX в границы от aa до bb — это площадь заштрихованной криволинейной трапеции под графиком функции f(x)f(x) на отрезке [a,b][a, b].

Фундаментальные свойства плотности вероятности

Чтобы функция могла служить плотностью распределения некоторой случайной величины, она обязана удовлетворять двум обязательным критериям:

  1. Неотрицательность:

    f(x)0для всех xRf(x) \geq 0 \quad \text{для всех } x \in \mathbb{R}

    Плотность не может уходить под ось абсцисс, ведь отрицательных площадей и вероятностей не бывает.
  2. Условие нормировки:

    +f(x)dx=1\int_{-\infty}^{+\infty} f(x)\,dx = 1

    Полная площадь под всем графиком функции плотности от -\infty до ++\infty в точности равна единице (достоверное событие: величина гарантированно примет хоть какое-то действительное значение).

Важнейшая ловушка для начинающих: значение функции плотности f(x)f(x) в конкретной точке не является вероятностью! Величина f(x)f(x) показывает лишь концентрацию вероятности около точки xx. В отличие от вероятности, которая строго ограничена диапазоном [0,1][0, 1], само значение f(x)f(x) вполне может быть больше единицы, если распределение сосредоточено на очень узком интервале.

Характеристика Дискретная случайная величина Непрерывная случайная величина
Закон распределения Таблица (ряд распределения) P(X=xi)=piP(X = x_i) = p_i Функция плотности вероятности f(x)f(x)
Вероятность в точке Может быть строго больше нуля: P(X=xi)>0P(X = x_i) > 0 Всегда равна нулю: P(X=c)=0P(X = c) = 0
Условие нормировки pi=1\sum p_i = 1 +f(x)dx=1\int_{-\infty}^{+\infty} f(x)\,dx = 1
Вероятность диапазона Сумма вероятностей точек: axibpi\sum_{a \leq x_i \leq b} p_i Площадь под кривой плотности: abf(x)dx\int_a^b f(x)\,dx

Разбор кейса: равномерное распределение времени ожидания

Закрепим концепцию на классическом примере из городской среды.

Поезд метро на кольцевой линии в час пик ходит строго каждые 4 минуты. Вы спускаетесь на платформу в случайный момент времени, не глядя на табло. Пусть непрерывная случайная величина XX — время вашего ожидания поезда (в минутах).

Очевидно, что XX принимает значения строго в диапазоне от 0 до 4 минут. При этом у вас нет оснований полагать, что прийти за 1 минуту до поезда вероятнее, чем за 3 минуты: все моменты времени в пределах интервала абсолютно равноправны. Такое распределение называется непрерывным равномерным.

График плотности вероятности f(x)f(x) на отрезке от 0 до 4 представляет собой горизонтальную линию на некоторой высоте CC, а вне этого отрезка f(x)=0f(x) = 0.

Шаг 1. Найдём высоту плотности CC из условия нормировки

Вся площадь под графиком f(x)f(x) должна равняться 1. Под графиком у нас обычный прямоугольник с основанием шириной 40=44 - 0 = 4 и высотой CC:

Площадь=Основание×Высота=4×C=1    C=14=0,25\text{Площадь} = \text{Основание} \times \text{Высота} = 4 \times C = 1 \implies C = \frac{1}{4} = 0{,}25

Таким образом, функция плотности задаётся формулой:

f(x)={0,25,если 0x40,если x<0 или x>4f(x) = \begin{cases} 0{,}25, & \text{если } 0 \leq x \leq 4 \\ 0, & \text{если } x < 0 \text{ или } x > 4 \end{cases}

Шаг 2. Вычислим вероятность ждать поезд от 1 до 3 минут

По нашему геометрическому правилу, P(1X3)P(1 \leq X \leq 3) — это площадь прямоугольника с основанием от 1 до 3:

P(1X3)=Ширина интервала×Высота=(31)×0,25=2×0,25=0,5P(1 \leq X \leq 3) = \text{Ширина интервала} \times \text{Высота} = (3 - 1) \times 0{,}25 = 2 \times 0{,}25 = 0{,}5

С вероятностью 50% поезд придёт в этом двухминутном окне.

А какова вероятность прождать ровно 2 минуты? Формально основание интервала равно нулю (22=02 - 2 = 0), поэтому площадь отрезка нулевая: P(X=2)=0P(X = 2) = 0.

Мост между дискретным и непрерывным: кумулятивная функция F(x)F(x)

Ранее мы познакомились с кумулятивной функцией распределения F(x)=P(Xx)F(x) = P(X \leq x), которая для дискретных величин выглядела как ступенчатая лестница, поднимающаяся от 0 до 1 с каждым новым возможным значением.

У непрерывной величины отдельных «скачков» нет, поскольку вероятность в каждой точке равна нулю. Поэтому для непрерывной случайной величины функция F(x)F(x) является гладкой, монотонно возрастающей непрерывной линией:

F(x)=P(Xx)=xf(t)dtF(x) = P(X \leq x) = \int_{-\infty}^{x} f(t)\,dt

Функция F(x)F(x) накапливает (аккумулирует) площадь под кривой плотности от крайней левой границы до текущей точки xx.

Связь между плотностью вероятности f(x)f(x) и функцией накопленной вероятности F(x)F(x) выражается через фундаментальную связь математического анализа — производную и интеграл:

  1. От плотности к функции распределения (интегрирование):

    F(x)=xf(t)dtF(x) = \int_{-\infty}^{x} f(t)\,dt

  2. От функции распределения к плотности (дифференцирование):

    f(x)=F(x)=dF(x)dxf(x) = F'(x) = \frac{dF(x)}{dx}

Плотность вероятности — это буквально скорость накапливания вероятности в окрестности точки xx. Где кривая F(x)F(x) круче всего взмывает вверх, там плотность f(x)f(x) достигает своего пика.

Благодаря F(x)F(x) вычисление вероятности попадания в любой интервал [a,b][a, b] избавляет нас от необходимости брать сложные интегралы вручную, если функция F(x)F(x) уже известна или табулирована:

P(aXb)=F(b)F(a)P(a \leq X \leq b) = F(b) - F(a)

Возвращаясь к нашему примеру с метро:

  • F(1)=0,25×1=0,25F(1) = 0{,}25 \times 1 = 0{,}25 (вероятность прождать не более 1 минуты);
  • F(3)=0,25×3=0,75F(3) = 0{,}25 \times 3 = 0{,}75 (вероятность прождать не более 3 минут);
  • P(1X3)=F(3)F(1)=0,750,25=0,50P(1 \leq X \leq 3) = F(3) - F(1) = 0{,}75 - 0{,}25 = 0{,}50.

Всё сошлось с точностью до миллиметра.

Теперь наш арсенал полон: мы умеем задавать как дискретные случайные процессы (число успехов, количество заявок), так и непрерывные (время, расстояние, масса, финансовые котировки). Однако чтобы уверенно принимать практические решения в условиях неопределённости, одного только графика распределения недостаточно. Нам нужен понятный численный ориентир — «центр тяжести» процесса, вокруг которого колеблются все исходы. К поиску этой центральной точки мы и перейдём.

Математическое ожидание как центр распределения

Математическое ожидание как центр распределения

Бросьте обычный шестигранный игральный кубик. Выпадет одно из чисел: 1, 2, 3, 4, 5 или 6. Теперь ответьте на простой вопрос: какое число вы ожидаете увидеть в среднем?

Математика даёт точный ответ: 3,5. Но на гранях кубика нет половинок — вы можете бросать его миллион раз, и ни в одном отдельном броске результат 3,5 физически не выпадет. Почему же характеристику, которая описывает типичный итог случайного эксперимента, называют «ожиданием», если наблюдать именно это значение в жизни зачастую невозможно?

Ответ кроется в переходе от единичного случая к картине в целом: математическое ожидание показывает не то, что случится в следующую секунду, а точку равновесия всей системы вероятностей.

От азартных пари к «справедливой стоимости»

В середине XVII века нидерландский учёный Христиан Гюйгенс написал первый в истории печатный трактат по теории вероятностей — «О расчётах в азартной игре» (De ratiociniis in ludo aleae, 1657 г.). Игроков того времени мучил практический вопрос: как справедливо разделить банк, если карточная партия прервана на середине?

Портрет Христиана Гюйгенса

Гюйгенс сформулировал принцип: ценность участия в игре равна той сумме, которую игрок получил бы в среднем, если бы партия повторялась бесконечное число раз при тех же условиях. Он ввёл термин expectatio — «ожидание», или «надежда на выигрыш». Это не предсказание исхода одной попытки, а эквивалентная денежная стоимость права участвовать в случайном процессе.

Если игра предлагает шанс 50% получить 1000 рублей и шанс 50% не получить ничего, её справедливая цена составляет ровно:

1000×0,5+0×0,5=500 рублей1000 \times 0{,}5 + 0 \times 0{,}5 = 500\text{ рублей}

Заплатив за вход меньше 500 рублей, вы в долгосрочной перспективе выигрываете; заплатив больше — гарантированно разоряетесь.

Дискретная величина: взвешенное среднее

В школьной математике среднее арифметическое находят просто: складывают все числа и делят на их количество. Для случайных величин этот подход работает только тогда, когда все исходы равновероятны. Но в реальной жизни разные события происходят с разной частотой.

Математическое ожидание дискретной случайной величины XX, обозначаемое как E[X]\mathbb{E}[X] (от французского espérance или английского expectation), — это взвешенная сумма всех возможных значений, где в роли весов выступают вероятности этих значений:

E[X]=i=1nxipi\mathbb{E}[X] = \sum_{i=1}^{n} x_i p_i

Здесь:

  • xix_i — конкретное числовое значение, которое может принять величина XX;
  • pip_i — вероятность появления именно этого значения (P(X=xi)P(X = x_i));
  • \sum — знак суммы по всем возможным исходам от 1 до nn.

Каждое значение «голосует» за себя своей вероятностью. Редкие значения почти не влияют на баланс, а частые — притягивают итоговый результат к себе.

Представьте курьера сервиса экспресс-доставки. За каждый доставленный заказ он получает чаевые. Анализ 500 поездок показал следующее распределение:

Размер чаевых (xix_i, RUB) Вероятность (pip_i) Вклад в ожидание (xipix_i \cdot p_i)
0 0,40 0×0,40=00 \times 0{,}40 = 0
100 0,35 100×0,35=35100 \times 0{,}35 = 35
200 0,20 200×0,20=40200 \times 0{,}20 = 40
500 0,05 500×0,05=25500 \times 0{,}05 = 25
Сумма 1,00 E[X]=100\mathbb{E}[X] = 100

Хотя размер 100 рублей действительно совпал с одним из возможных вариантов, это случайность примера. Главный вывод иной: рассчитывая бюджет на месяц из расчёта 200 доставок, курьер может уверенно закладывать в доход от чаевых:

200×100=20000 рублей200 \times 100 = 20\,000\text{ рублей}

Одиночный заказ непредсказуем: клиент может оставить щедрые 500 рублей или ноль. Но сумма по длинной цепочке заказов стремится к сумме их математических ожиданий.

Физический смысл: центр тяжести распределения

Формула E[X]=xipi\mathbb{E}[X] = \sum x_i p_i подозрительно напоминает формулу из курса механики. Если расположить на невесомой линейке грузы массами mim_i в точках с координатами xix_i, то центр масс этой системы найдётся по формуле:

xc=ximimix_c = \frac{\sum x_i m_i}{\sum m_i}

В теории вероятностей сумма всех весов (вероятностей) всегда равна единице благодаря условию нормировки: pi=1\sum p_i = 1. Знаменатель исчезает, и формула центра тяжести в точности совпадает с математическим ожиданием.

Математическое ожидание — это точка баланса распределения. Если положить числовую ось на остриё клина в точке x=E[X]x = \mathbb{E}[X], распределение останется в идеальном горизонтальном равновесии.

Если распределение вероятностей симметрично относительно некоторой точки cc, то математическое ожидание обязано совпадать с этой точкой: E[X]=c\mathbb{E}[X] = c. Именно поэтому для кубика со значениями 1, 2, 3, 4, 5, 6 центр симметрии находится точно посередине — в точке 3,5.

Непрерывная величина: от суммирования к интегралу

Для непрерывных случайных величин (время ожидания, рост человека, температура воздуха) вероятность принять отдельное фиксированное значение равна нулю. Вместо отдельных точечных вероятностей pip_i здесь работает функция плотности f(x)f(x).

Чтобы найти точку баланса для сплошной кривой плотности, суммирование заменяют интегрированием:

E[X]=+xf(x)dx\mathbb{E}[X] = \int_{-\infty}^{+\infty} x \cdot f(x) \, dx

Здесь:

  • xx — координата на числовой оси;
  • f(x)dxf(x) \, dx — элементарная масса (вероятность), сосредоточенная на бесконечно малом отрезке от xx до x+dxx + dx;
  • интеграл собирает сумму моментов по всей бесконечной прямой.

Геометрически математическое ожидание непрерывной величины — это абсцисса центра тяжести плоской геометрической фигуры, ограниченной сверху графиком плотности f(x)f(x), а снизу — осью OxOx.

Пример: равномерное распределение

Пассажир приходит на остановку, где автобусы отправляются строго каждые 20 минут, но расписание ему неизвестно. Время ожидания XX распределено равномерно на отрезке [0;20][0; 20] минут. Плотность постоянна: f(x)=120f(x) = \frac{1}{20} при x[0;20]x \in [0; 20].

Вычислим математическое ожидание:

E[X]=020x120dx=x240020=400400=10 минут\mathbb{E}[X] = \int_{0}^{20} x \cdot \frac{1}{20} \, dx = \left. \frac{x^2}{40} \right|_{0}^{20} = \frac{400}{40} - 0 = 10\text{ минут}

Фигура под графиком — прямоугольник с основанием от 0 до 20. Его геометрический центр симметрии лежит в точке 10. В среднем пассажир ожидает половину максимального интервала.

Фундаментальные свойства математического ожидания

Математическое ожидание обладает математической «элегантностью»: оно линейно. Это свойство избавляет от громоздких расчётов при масштабировании данных и оценке сложных составных систем.

1. Ожидание константы

Константа не случайна, она не меняется:

E[c]=c\mathbb{E}[c] = c

2. Вынос постоянного множителя

Если все исходы увеличить в aa раз, центр распределения сдвинется во столько же раз:

E[aX]=aE[X]\mathbb{E}[aX] = a \cdot \mathbb{E}[X]

Пример: если выручка магазина в долларах имеет математическое ожидание 1000 USD, а курс конвертации составляет 90 рублей за доллар, то ожидание выручки в рублях равно 90×1000=90000 рублей90 \times 1000 = 90\,000\text{ рублей}.

3. Сдвиг на константу

Прибавление фиксированного числа сдвигает всю числовую ось, не меняя формы распределения:

E[X+b]=E[X]+b\mathbb{E}[X + b] = \mathbb{E}[X] + b

Объединяя масштабирование и сдвиг, получаем линейность для произвольной прямой:

E[aX+b]=aE[X]+b\mathbb{E}[aX + b] = a\mathbb{E}[X] + b

4. Аддитивность: ожидание суммы

Для любых двух случайных величин XX и YY верно:

E[X+Y]=E[X]+E[Y]\mathbb{E}[X + Y] = \mathbb{E}[X] + \mathbb{E}[Y]

Суперсила линейности: равенство E[X+Y]=E[X]+E[Y]\mathbb{E}[X + Y] = \mathbb{E}[X] + \mathbb{E}[Y] выполняется ВСЕГДА — независимо от того, связаны величины между собой или независимы.

Если XX — время сборки первой детали станка, а YY — время сборки второй, то среднее общее время равно сумме их средних времен, даже если поломка на первом этапе регулярно затягивает второй этап.

Границы применимости: почему одного центра недостаточно

Математическое ожидание — базовый ориентир для принятия рациональных решений, но полагаться исключительно на него рискованно.

Представьте два инвестиционных предложения с горизонтом в один год:

  • Проект Альфа: гарантированный возврат с прибылью 100 000 рублей.
  • Проект Бета: с вероятностью 50% приносит 1 000 000 рублей, а с вероятностью 50% оборачивается убытком в 800 000 рублей.

Рассчитаем ожидание прибыли для проекта Бета:

E[Бета]=1000000×0,5+(800000)×0,5=500000400000=100000 рублей\mathbb{E}[\text{Бета}] = 1\,000\,000 \times 0{,}5 + (-800\,000) \times 0{,}5 = 500\,000 - 400\,000 = 100\,000\text{ рублей}

Оба проекта обладают совершенно одинаковым математическим ожиданием прибыли: 100 000 рублей. Однако ни один разумный финансовый менеджер не сочтёт их эквивалентными:

  • В проекте Альфа разброс вокруг центра равен нулю — риска нет.
  • В проекте Бета размах колебаний колоссален: фирма рискует потерять 800 000 рублей и обанкротиться.

Математическое ожидание фиксирует положение центра масс, но абсолютно ничего не сообщает о том, насколько широко раскиданы грузы вокруг этой точки опоры. Чтобы измерить степень этого разброса, риск и неопределённость, требуется следующая фундаментальная пара характеристик — дисперсия и стандартное отклонение.

Дисперсия и стандартное отклонение: оценка риска и разброса

Дисперсия и стандартное отклонение: оценка риска и разброса

Старый медицинский анекдот гласит: у пациента в реанимации температура тела была +42 °C, а у другого в морге — 0 °C, но в среднем по отделению температура составила образцовые +21 °C. В прошлой теме мы выяснили, что математическое ожидание находит баланс случайной величины, её гравитационный центр. Однако знание только центра коварно: оно ничего не сообщает о том, насколько далеко реальные события могут от этого центра отскочить. Если река имеет среднюю глубину 1 метр, можно ли переходить её вброд? Если посреди русла скрывается яма глубиной 4 метра — попытка закончится трагедией.

Чтобы принимать взвешенные решения в условиях неопределённости, одного математического ожидания недостаточно. Необходима математическая мера риска — число, которое честно покажет, насколько широк разброс возможных исходов.

В поисках идеальной меры разброса

Представим двух специалистов-фрилансеров — копирайтера Елену и веб-разработчика Максима. Оба работают на нестабильном рынке, и оба за последние два года получают одинаковый средний доход: их математическое ожидание заработка равно 150 000 RUB в месяц.

Но структура их доходов принципиально различается:

  • Елена работает с постоянными клиентами на долгосрочных контрактах. В не самый удачный месяц она зарабатывает 140 000 RUB, в обычный — 150 000 RUB, а в сверхудачный — 160 000 RUB (каждый исход равновероятен с вероятностью 1/31/3).
  • Максим берётся за разовые рискованные стартап-проекты. С вероятностью 1/31/3 его проект проваливается и он получает 0 RUB, с вероятностью 1/31/3 проект приносит умеренный доход 100 000 RUB, а с вероятностью 1/31/3 выстреливает крупным гонораром в 350 000 RUB.

У обоих E[X]=150000E[X] = 150\,000 RUB. Но если Елена спокойно может планировать ежемесячные платежи по ипотеке, то для Максима такой шаг стал бы финансовой катастрофой. Их риски кардинально несопоставимы.

Как оцифровать эту разницу? Логичный первый шаг — посмотреть, на сколько каждое конкретное значение XX отклоняется от среднего E[X]E[X]. То есть исследовать величину отклонения:

XE[X]X - E[X]

Попробуем найти среднее значение этого отклонения, применив операцию математического ожидания:

E[XE[X]]E[X - E[X]]

Используя изученное свойство линейности математического ожидания, раскроем скобки:

E[XE[X]]=E[X]E[E[X]]E[X - E[X]] = E[X] - E[E[X]]

Поскольку E[X]E[X] — это уже фиксированное число (константа), а математическое ожидание константы равно самой константе, получаем:

E[X]E[X]=0E[X] - E[X] = 0

Возник концептуальный тупик: среднее отклонение от центра всегда строго равно нулю для абсолютно любой случайной величины. Положительные отклонения (доходы выше среднего) и отрицательные отклонения (доходы ниже среднего) идеально уравновешивают друг друга на рычаге математического ожидания.

Чтобы измерить расстояние, нам нужно нейтрализовать знаки «минус». Математика предлагает два очевидных способа сделать числа неотрицательными: модуль и квадрат.

Идея взять средний модуль отклонений, то есть E[XE[X]]E[|X - E[X]|], кажется интуитивной. Однако операция модуля имеет резкий излом в нуле, недифференцируема и крайне неудобна в аналитических вычислениях. Поэтому математики выбрали второй путь: возведение отклонений в квадрат.

Дисперсия: средний квадрат отклонений

Возведение разности в квадрат решает сразу две задачи: превращает все отклонения в строго неотрицательные величины и прогрессивно «наказывает» редкие, но катастрофически далёкие выбросы (отклонение в 10 единиц при возведении в квадрат даёт 100, а отклонение в 2 единицы — всего 4).

Дисперсия случайной величины (от латинского dispersio — рассеяние; в англоязычной литературе — variance, обозначается Var(X)\mathrm{Var}(X) или D[X]D[X]) — это математическое ожидание квадрата отклонения случайной величины от её математического ожидания:

D[X]=E[(XE[X])2]D[X] = E\left[(X - E[X])^2\right]

Если случайная величина XX дискретна и принимает значения x1,x2,,xnx_1, x_2, \dots, x_n с вероятностями p1,p2,,pnp_1, p_2, \dots, p_n, то дисперсия вычисляется как взвешенная сумма квадратов расстояний до центра:

D[X]=i=1n(xiE[X])2piD[X] = \sum_{i=1}^n (x_i - E[X])^2 \cdot p_i

Для непрерывной величины с плотностью вероятности f(x)f(x) суммирование заменяется интегрированием:

D[X]=+(xE[X])2f(x)dxD[X] = \int_{-\infty}^{+\infty} (x - E[X])^2 f(x)\,dx

Считаем дисперсию: Елена против Максима

Вернёмся к нашим фрилансерам и рассчитаем дисперсию дохода для каждого из них. Математическое ожидание у обоих равно 150 000 RUB.

Для Елены:

  1. Отклонения от среднего:

    • При доходе 140 000: 140000150000=10000140\,000 - 150\,000 = -10\,000
    • При доходе 150 000: 150000150000=0150\,000 - 150\,000 = 0
    • При доходе 160 000: 160000150000=+10000160\,000 - 150\,000 = +10\,000
  2. Квадраты отклонений:

    • (10000)2=100000000(-10\,000)^2 = 100\,000\,000
    • 02=00^2 = 0
    • (10000)2=100000000(10\,000)^2 = 100\,000\,000
  3. Умножаем на вероятности (1/31/3) и суммируем:

    D[XЕлена]=10000000013+013+10000000013=200000000366666667D[X_{\text{Елена}}] = 100\,000\,000 \cdot \frac{1}{3} + 0 \cdot \frac{1}{3} + 100\,000\,000 \cdot \frac{1}{3} = \frac{200\,000\,000}{3} \approx 66\,666\,667

Для Максима:

  1. Отклонения от среднего:

    • При доходе 0: 0150000=1500000 - 150\,000 = -150\,000
    • При доходе 100 000: 100000150000=50000100\,000 - 150\,000 = -50\,000
    • При доходе 350 000: 350000150000=+200000350\,000 - 150\,000 = +200\,000
  2. Квадраты отклонений:

    • (150000)2=22500000000(-150\,000)^2 = 22\,500\,000\,000
    • (50000)2=2500000000(-50\,000)^2 = 2\,500\,000\,000
    • (200000)2=40000000000(200\,000)^2 = 40\,000\,000\,000
  3. Умножаем на вероятности (1/31/3) и суммируем:

    D[XМаксим]=22500000000+2500000000+400000000003=65000000000321666666667D[X_{\text{Максим}}] = \frac{22\,500\,000\,000 + 2\,500\,000\,000 + 40\,000\,000\,000}{3} = \frac{65\,000\,000\,000}{3} \approx 21\,666\,666\,667

Сравните числа: около 67 миллионов у Елены против почти 22 миллиардов у Максима. Дисперсия наглядно и беспощадно показала гигантскую разницу в степени риска.

Удобная вычислительная формула

Считать дисперсию по базовому определению вручную тяжело: приходится вычитать среднее из каждого значения, возводить громоздкие остатки в квадрат и лишь потом усреднять. К счастью, определение можно упростить с помощью алгебры.

Раскроем квадрат разности внутри математического ожидания:

D[X]=E[X22XE[X]+(E[X])2]D[X] = E\left[X^2 - 2X \cdot E[X] + (E[X])^2\right]

Используя свойство линейности и помня, что E[X]E[X] — постоянное число:

D[X]=E[X2]2E[X]E[X]+(E[X])2=E[X2]2(E[X])2+(E[X])2D[X] = E[X^2] - 2E[X] \cdot E[X] + (E[X])^2 = E[X^2] - 2(E[X])^2 + (E[X])^2

Приведя подобные слагаемые, получаем ключевую вычислительную формулу теории вероятностей:

D[X]=E[X2](E[X])2D[X] = E[X^2] - (E[X])^2

Формула для вычисления дисперсии: Дисперсия равна математическому ожиданию квадрата случайной величины минус квадрат её математического ожидания.

Эта формула требует всего двух шагов: найти обычное среднее E[X]E[X], затем среднее квадратов значений E[X2]E[X^2], после чего вычесть из второго первое, возведённое в квадрат.

Парадокс «квадратных рублей» и спасительное стандартное отклонение

Взглянем на единицы измерения полученной дисперсии доходов. Мы возводили рубли в квадрат. Значит, дисперсия дохода Елены составляет 6666666766\,666\,667 «рублей в квадрате».

Что такое «квадратный рубль»? Или «квадратная минута» опоздания поезда? Или «квадратный градус Цельсия» температуры больного? Физический и экономический смысл таких единиц неочевиден. Из-за возведения в квадрат дисперсия несопоставима с исходными величинами по масштабу.

Чтобы вернуть меру разброса в нормальные, исходные единицы измерения, Карл Пирсон в 1893 году предложил извлекать из дисперсии квадратный корень.

Стандартное отклонение (среднеквадратичное отклонение, обозначается греческой буквой σ\sigma — «сигма», в англоязычной литературе standard deviation, sd\mathrm{sd}):

σ=D[X]\sigma = \sqrt{D[X]}

Рассчитаем стандартное отклонение для Елены и Максима:

  • Для Елены:

    σЕлена=666666678165 RUB\sigma_{\text{Елена}} = \sqrt{66\,666\,667} \approx 8\,165\text{ RUB}

  • Для Максима:

    σМаксим=21666666667147196 RUB\sigma_{\text{Максим}} = \sqrt{21\,666\,666\,667} \approx 147\,196\text{ RUB}

Теперь картина предельно ясна и выражена в обычных рублях:

  • Доход Елены в среднем отклоняется от 150 000 RUB всего на 8 165 RUB (колебания порядка ±5%\pm 5\%).
  • Доход Максима отклоняется от среднего на внушительные 147 196 RUB (колебания порядка ±100%\pm 100\%).

Свойства дисперсии: как разброс реагирует на изменения

Чтобы уверенно оперировать дисперсией в реальных задачах, необходимо понимать, как она ведёт себя при простейших трансформациях данных.

1. Дисперсия константы равна нулю

Константа CC не является случайной — она не меняется ни при каких обстоятельствах. Её отклонение от самой себя всегда равно нулю:

D[C]=0D[C] = 0

2. Прибавление константы не меняет дисперсию (сдвиг)

Представьте, что государство решило поддержать всех самозанятых и безусловно доплачивает каждому фиксированные 20 000 RUB в месяц. Доход Елены сдвинется: вместо 140, 150 и 160 тысяч она будет получать 160, 170 и 180 тысяч.

Средний доход вырастет ровно на 20 000 RUB. Но изменился ли разброс между исходами? Нет: дистанция между худшим и лучшим месяцем как была 20 000 RUB, так и осталась. Распределение целиком сдвинулось по числовой оси, не расширившись и не сжавшись.

D[X+C]=D[X]D[X + C] = D[X]

3. Умножение на константу выносит её в квадрате (масштабирование)

Если доходы специалистов вырастут в 2 раза (умножение на коэффициент a=2a = 2), то и отклонения от среднего удвоятся. А поскольку в дисперсии отклонения возводятся в квадрат, сама дисперсия вырастет в 22=42^2 = 4 раза:

D[aX]=a2D[X]D[aX] = a^2 \cdot D[X]

Для стандартного отклонения корень нейтрализует квадрат (с учётом знака через модуль):

σ(aX)=aσ(X)\sigma(aX) = |a| \cdot \sigma(X)

4. Дисперсия суммы независимых величин

Если вы бросаете два кубика или формируете портфель из некоррелирующих активов, их суммарный разброс накапливается.

Для независимых случайных величин XX и YY дисперсия их суммы равна сумме их дисперсий:

D[X+Y]=D[X]+D[Y]D[X + Y] = D[X] + D[Y]

Обратите внимание на ловушку, в которую часто попадают новички: стандартные отклонения напрямую не складываются!

σX+Y=D[X+Y]=σX2+σY2σX+σY\sigma_{X+Y} = \sqrt{D[X + Y]} = \sqrt{\sigma_X^2 + \sigma_Y^2} \neq \sigma_X + \sigma_Y

Это фундаментальное математическое свойство лежит в основе финансовой диверсификации: объединяя независимые рискованные активы, суммарный риск (стандартное отклонение) растёт медленнее, чем сумма индивидуальных рисков.

Сведём поведение характеристик при преобразованиях в наглядную таблицу:

Операция над XX Математическое ожидание E[]E[\cdot] Дисперсия D[]D[\cdot] Стандартное отклонение σ[]\sigma[\cdot]
Сдвиг на константу (X+CX + C) E[X]+CE[X] + C D[X]D[X] σ[X]\sigma[X]
Умножение на число (aXaX) aE[X]a \cdot E[X] a2D[X]a^2 \cdot D[X] aσ[X]|a| \cdot \sigma[X]
Линейное преобразование (aX+baX + b) aE[X]+ba E[X] + b a2D[X]a^2 D[X] aσ[X]|a| \sigma[X]
Сумма независимых (X+YX + Y) E[X]+E[Y]E[X] + E[Y] D[X]+D[Y]D[X] + D[Y] σX2+σY2\sqrt{\sigma_X^2 + \sigma_Y^2}

Дисперсия как фундамент оценки неопределенности

Математическое ожидание указывает, куда целиться, а дисперсия и стандартное отклонение показывают, какова кучность стрельбы. Без пары (E[X],σ)(E[X], \sigma) любая оценка случайного процесса неполноценна:

  • В производстве стандартное отклонение детали от чертежа определяет процент заводского брака.
  • В логистике σ\sigma времени доставки позволяет честно обещать клиенту интервал ожидания посылки.
  • В медицине разброс артериального давления пациента при приёме препарата свидетельствует о стабильности его действия.

Мы научились измерять центр случайной величины и её размах. Но как объединить обе характеристики, чтобы ответить на прикладные вопросы: с какой вероятностью прибыль упадёт ниже критической отметки, сколько страхового резерва заложить на непредвиденные сбои и какой проект предпочесть, когда доходность и риск вступают в конфликт? Этим правилам принятия решений посвящена заключительная глава курса.

Принятие решений на основе числовых характеристик

Принятие решений на основе числовых характеристик

Представьте две службы доставки еды. Обе обещают: «В среднем наш курьер приедет за 30 минут». Но за этим одинаковым средним значением кроются совершенно разные сценарии. У первой службы стандартное отклонение составляет 3 минуты, а у второй — 18 минут. Заказывая обед перед важным созвоном, вы интуитивно выберете первую компанию: риск опоздания минимален. Но что делать, если нужно сравнить стабильность выручки скромной кофейни у дома со стабильностью федеральной торговой сети? Или когда необходимо точно рассчитать вероятность того, что поставка сорвется более чем на час?

Математическое ожидание указывает на центр притяжения событий, а дисперсия со стандартным отклонением измеряют размах неопределенности. Пришло время собрать эти характеристики в единую систему принятия решений: научиться сравнивать несравнимые по масштабу процессы, рассчитывать гарантированные границы безопасности для любых величин и правильно соотносить выгоду с риском.

Ловушка абсолютных величин: коэффициент вариации

Абсолютное значение стандартного отклонения σ\sigma выражается в тех же единицах, что и сама случайная величина. Однако одна и та же цифра может означать совершенно разный уровень неопределенности в зависимости от масштаба процесса.

Рассмотрим работу двух частных инвесторов:

  • Инвестор А вложил деньги в консервативный облигационный фонд. Среднемесячная доходность составляет 20 000 рублей, а стандартное отклонение доходности σ=2 000\sigma = 2\ 000 рублей.
  • Инвестор Б управляет венчурным фондом. Его средняя месячная прибыль равна 2 000 000 рублей при стандартном отклонении σ=100 000\sigma = 100\ 000 рублей.

У кого из них инвестиционная стратегия более рискованна и нестабильна?

Если смотреть исключительно на σ\sigma, то у инвестора Б колебания в 50 раз выше (100 000100\ 000 против 2 0002\ 000). Но для портфеля в два миллиона рублей колебание на сто тысяч — это легкая рябь в 5%5\%, тогда как для скромного дохода в двадцать тысяч рублей скачок на две тысячи составляет целых 10%10\%.

Чтобы устранить влияние масштаба единиц измерения и объективно сопоставить разброс, используют коэффициент вариации (CVCV).

Коэффициент вариации — это безразмерная относительная мера разброса случайной величины, показывающая, какую долю от математического ожидания составляет стандартное отклонение:

CV=σμCV = \frac{\sigma}{\mu}

Здесь σ\sigma — стандартное отклонение случайной величины, а μ\mu — её математическое ожидание (при условии, что μ>0\mu > 0). Часто результат умножают на 100%100\%, чтобы выразить показатель в процентах.

Посчитаем коэффициент вариации для наших инвесторов:

  • Для инвестора А: CVA=2 00020 000=0,10CV_A = \frac{2\ 000}{20\ 000} = 0{,}10 (или 10%10\%).
  • Для инвестора Б: CVБ=100 0002 000 000=0,05CV_Б = \frac{100\ 000}{2\ 000\ 000} = 0{,}05 (или 5%5\%).

Несмотря на колоссальную разницу в абсолютных суммах, доходность инвестора Б в два раза стабильнее относительно своего среднего, чем доходность инвестора А.

В практическом анализе данных и риск-менеджменте часто опираются на классическую эмпирическую шкалу стабильности:

Значение CVCV Уровень изменчивости Степень предсказуемости процесса
До 10%10\% Низкая (незначительная) Высокая однородность, процесс стабилен
От 10%10\% до 33%33\% Средняя (умеренная) Умеренная вариация, результат надежен
Более 33%33\% Высокая (значительная) Неоднородная среда, повышенный риск решений

Коэффициент вариации незаменим, когда требуется сравнить характеристики в принципиально разных единицах: например, сравнить стабильность температуры реактора в градусах со стабильностью давления в паскалях.

Границы неизвестности: неравенство Чебышёва

Коэффициент вариации помогает сравнивать относительную стабильность, но не отвечает на вопрос: какова вероятность того, что случайная величина выйдет за допустимые рамки?

На практике закон распределения величины часто неизвестен: у нас нет точной формулы плотности или полного ряда распределения. Всё, чем мы располагаем на основе исторических наблюдений, — это среднее значение μ\mu и разброс σ\sigma. Можно ли сделать строгие вероятностные выводы при столь скудных данных?

Ответ на этот фундаментальный вопрос нашел выдающийся математик XIX века Пафнутий Львович Чебышёв.

Портрет П. Л. Чебышёва

Чебышёв доказал теорему, связывающую математическое ожидание и дисперсию с вероятностью отклонения величины от своего центра. Это утверждение верно для абсолютно любой случайной величины (дискретной или непрерывной) с конечной дисперсией, независимо от формы её графика.

Неравенство Чебышёва: Какова бы ни была случайная величина XX с математическим ожиданием μ\mu и стандартным отклонением σ\sigma, для любого положительного числа k>0k > 0 вероятность того, что величина отклонится от среднего более чем на kk стандартных отклонений, не превышает 1k2\frac{1}{k^2}:

P(Xμkσ)1k2P(|X - \mu| \geq k\sigma) \leq \frac{1}{k^2}

Выражение Xμkσ|X - \mu| \geq k\sigma описывает ситуацию, когда значение величины оказывается вне симметричного интервала [μkσ,μ+kσ][\mu - k\sigma,\, \mu + k\sigma].

Если нас интересует противоположное событие — попадание внутрь безопасного коридора, неравенство Чебышёва принимает эквивалентную форму:

P(Xμ<kσ)11k2P(|X - \mu| < k\sigma) \geq 1 - \frac{1}{k^2}

Давайте проверим, что гарантирует неравенство для различных множителей kk:

  • При k=2k = 2: P(Xμ<2σ)1122=10,25=0,75P(|X - \mu| < 2\sigma) \geq 1 - \frac{1}{2^2} = 1 - 0{,}25 = 0{,}75 (не менее 75%75\%).
  • При k=3k = 3: P(Xμ<3σ)1132=1190,889P(|X - \mu| < 3\sigma) \geq 1 - \frac{1}{3^2} = 1 - \frac{1}{9} \approx 0{,}889 (не менее 88,9%88{,}9\%).
  • При k=5k = 5: P(Xμ<5σ)1125=0,96P(|X - \mu| < 5\sigma) \geq 1 - \frac{1}{25} = 0{,}96 (не менее 96%96\%).

Разберем жизненный пример. Склад интернет-магазина обрабатывает заказы. Известно, что среднее время сборки заказа составляет μ=40\mu = 40 минут, а стандартное отклонение σ=5\sigma = 5 минут. Вид распределения неизвестен: это может быть асимметричный график со всплесками в часы пик. Какова вероятность того, что время сборки случайно выбранного заказа уложится в диапазон от 25 до 55 минут?

  1. Определим ширину диапазона: границами служат 25=401525 = 40 - 15 и 55=40+1555 = 40 + 15.
  2. Максимальное отклонение равно 1515 минутам.
  3. Выразим отклонение через количество сигм: kσ=15k\sigma = 15, откуда k=155=3k = \frac{15}{5} = 3.
  4. Применяем неравенство Чебышёва:

    P(X40<15)1132=1190,889P(|X - 40| < 15) \geq 1 - \frac{1}{3^2} = 1 - \frac{1}{9} \approx 0{,}889

Менеджер склада может с математической гарантией утверждать: как минимум 88,9%88{,}9\% всех заказов будут собраны в интервале от 25 до 55 минут. Это «железная» граница надежности, справедливая при любом сценарии.

Симметрия природы: правило трёх сигм

Неравенство Чебышёва платит за свою всеобщность консервативностью: оценка снизу в 88,9%88{,}9\% гарантирует минимум, но в реальности доля значений внутри коридора часто оказывается намного выше. Если процесс формируется под воздействием множества независимых мелких случайных факторов (рост людей, погрешности станков, время отклика серверов), распределение величины становится гладким, симметричным и колоколообразным — нормальным (гауссовым).

Для величин, подчиняющихся нормальному распределению, вероятности попадания в интервалы вокруг среднего вычисляются строго и задают знаменитое правило трёх сигм:

  • В интервал [μ1σ,μ+1σ][\mu - 1\sigma,\, \mu + 1\sigma] попадает приблизительно 68,27%68{,}27\% всех значений.
  • В интервал [μ2σ,μ+2σ][\mu - 2\sigma,\, \mu + 2\sigma] попадает приблизительно 95,45%95{,}45\% всех значений.
  • В интервал [μ3σ,μ+3σ][\mu - 3\sigma,\, \mu + 3\sigma] попадает приблизительно 99,73%99{,}73\% всех значений.

Посмотрите на разницу в оценках для интервала в три сигмы: неравенство Чебышёва гарантирует не менее 88,9%88{,}9\% для произвольного распределения, а нормальный закон дает уже 99,73%99{,}73\%.

На этом свойстве основан классический статистический контроль качества (контрольные карты Шухарта) в промышленном производстве: если технологические допуски детали шире интервала ±3σ\pm 3\sigma от целевого размера, то шанс выпустить дефектную деталь составляет всего 100%99,73%=0,27%100\% - 99{,}73\% = 0{,}27\% (около 27 дефектных изделий на 10 тысяч).

Сравним два подхода к оценке рисков:

Параметр коридора Неравенство Чебышёва (для любого распределения) Правило трёх сигм (только для нормального закона)
[μ1σ,μ+1σ][\mu - 1\sigma,\, \mu + 1\sigma] Не дает содержательной оценки (P0P \geq 0) 68,3%\approx 68{,}3\% значений внутри коридора
[μ2σ,μ+2σ][\mu - 2\sigma,\, \mu + 2\sigma] Гарантирует не менее 75,0%75{,}0\% внутри 95,5%\approx 95{,}5\% значений внутри коридора
[μ3σ,μ+3σ][\mu - 3\sigma,\, \mu + 3\sigma] Гарантирует не менее 88,9%88{,}9\% внутри 99,73%\approx 99{,}73\% (выход за пределы — крайне редкое событие)
Условия применения Распределение любое, конечная дисперсия Строго нормальное (колоколообразное) распределение

Если вы не уверены в характере процесса (например, при моделировании финансовых кризисов или сбоев в сети), завышение оптимизма опасно: следует опираться на неравенство Чебышёва. Если же физика процесса опирается на сложение десятков независимых случайных помех, нормальное приближение дает точный ориентир.

Матрица решений: баланс выигрыша и риска

Каждая случайная величина, с которой мы сталкиваемся в реальных задачах, описывает два измерения будущего:

  1. Математическое ожидание μ\mu — ожидаемый результат (выигрыш, средний срок, средняя прибыль).
  2. Стандартное отклонение σ\sigma или коэффициент вариации CVCV — неопределенность этого результата (риск потерь, нестабильность, размах непредвиденных задержек).

Принятие решений в условиях неопределенности сводится к компромиссу между этими осями. Представим выбор между четырьмя вариантами логистических маршрутов:

          Высокое ожидание (быстрая доставка)
                        ▲
                        │      Маршрут Б
           Маршрут А    │      (быстрый, но с
          (идеальный:   │       высоким риском пробок)
           быстрый и    │
           надежный)    │
                        │
  Низкий риск ──────────┼──────────► Высокий риск (разброс сигма)
  (малая сигма)         │
           Маршрут В    │      Маршрут Г
          (медленный,   │      (медленный и
           но предельно │       непредсказуемый)
           стабильный)  │
                        │
  • Маршрут А безоговорочно выигрывает у всех: минимальное время в пути и минимальный разброс.
  • Маршрут Г иррационален: он долгий и при этом нестабильный.
  • Реальная дилемма всегда возникает между Маршрутом Б и Маршрутом В: предпочесть ли меньшее среднее время ценой риска застрять в непредсказуемой пробке, либо согласиться на медленную, но гарантированную по времени поездку?

Рациональный выбор зависит от контекста и цены ошибки. Если опоздание на 10 минут означает срыв международного контракта, человек жертвует средним выигрышем ради минимизации σ\sigma. Если же речь идет о серии из сотен повторяющихся доставок товаров со склада, где важен совокупный суммарный результат, решающим фактором становится максимизация математического ожидания.

Теперь вы владеете полным арсеналом понятий: от абстрактной случайной величины как функции на исходах эксперимента до её законов распределения и числовых метрик. Числовые характеристики превращают неопределенность из пугающего хаоса в измеримый, сравнимый и управляемый инженерный параметр.