1.1 Дорожная карта курса
Автор: yuriy · Карточек: 4
Коротко. Коротко
Курс состоит из двух пластов: теоретического (теория вероятностей) и практического (сбор данных, описательные статистики, визуализация). Они идут вперемешку, а не друг за другом.
Теория нужна не сама по себе: каждое понятие отсюда всплывёт в следующих курсах специализации — в статистике, в A/B-тестах, в машинном обучении.
Две главные теоремы курса — центральная предельная теорема (ЦПТ) и закон больших чисел (ЗБЧ). Они объясняют, почему статистические методы вообще работают.
Практика: свой парсер на Python, сбор данных о мемах, разведочный анализ (EDA) и визуализация.
Главная цель недели — собрать «клубок» определений, в котором всё связано друг с другом, и увидеть, что теория напрямую сцеплена с реальными данными.
1. Зачем вообще нужен этот курс
Курс — вводный кирпич специализации. Его задача не «рассказать теорвер ещё раз», а собрать тот минимальный набор понятий, на который потом будет опираться всё остальное: проверка гипотез, доверительные интервалы, регрессия, метрики качества моделей.
Логика простая: эти определения будут всплывать постоянно, значит разобраться в них надо досконально и один раз, а не догадываться каждый раз заново.
2. Теоретический пласт
2.1. Базовые определения
Первое, что разбирается, — словарь, без которого дальше не поговорить:
| Понятие | Что отвечает на вопрос | Разбирается в уроке |
|---|---|---|
| Случайная величина | Что мы вообще измеряем? | 1.3 |
| Закон распределения | С какими вероятностями она принимает значения? | 1.3 |
| Плотность распределения | То же, но для непрерывного случая | 1.3 |
| Функция распределения | Какова вероятность оказаться левее точки? | 1.3 |
| Математическое ожидание | Какое значение типично? | 1.4 |
| Дисперсия | Насколько сильно значения разбросаны? | 1.4 |
Причём считать эти характеристики предстоит для самых разных распределений, а не только для одного учебного примера.
2.2. Зоопарк распределений и связь с реальностью
Отдельная большая тема — какие случайные величины бывают «в природе»: когда уместно одно распределение, когда другое. Цель — не выучить список формул, а провязать распределения с реальностью и научиться отвечать на вопрос: «какую модель тут разумно выбрать?»
Это разбирается в уроке 1.5.
2.3. Симуляции на Python
Все эти случайные величины предстоит научиться симулировать в Python. Это не декоративный навык: симуляция — рабочий инструмент. Когда аналитическая формула не выводится или выводится тяжело, ставится численный эксперимент.
Совет. Зачем это на практике Симуляция отвечает на вопросы вида «а что будет, если…», когда честная математика слишком трудна:
Сколько в среднем придётся ждать, если очередь устроена вот так?
Какова вероятность, что при таком трафике сервис упрётся в лимит?
Насколько «случайной» могла быть разница между вариантами A и B в эксперименте?
Метод в общем виде называется методом Монте-Карло: прогнать процесс много тысяч раз и посмотреть на распределение исходов.
2.4. Две теоремы, на которых держится статистика
Центральная предельная теорема (ЦПТ). Неформально: сумма (или среднее) большого числа независимых слагаемых ведёт себя примерно как нормальное распределение — почти независимо от того, как распределены сами слагаемые.
\frac{\bar{X}_n - \mu}{\sigma / \sqrt{n}} \xrightarrow[n \to \infty]{} N(0, 1)
Исходные слагаемые — равномерные, то есть на колокол совсем не похожи. Но уже при n = 12 распределение их среднего практически сливается с N(0, 1).
Именно поэтому нормальное распределение «лезет из всех щелей». Важная часть разговора — когда ЦПТ применять нельзя (например, при тяжёлых хвостах или зависимых наблюдениях). Дальше по курсу это будет проговариваться каждый раз, когда очередной статистический метод на неё опирается.
Закон больших чисел (ЗБЧ). Неформально: выборочное среднее с ростом объёма выборки сходится к истинному матожиданию.
\bar{X}_n = \frac{1}{n}\sum_{i=1}^{n} X_i \xrightarrow[n \to \infty]{} \mathbb{E}(X)
Четыре независимые серии бросков кости. На первых десятках бросков среднее скачет как угодно, дальше все траектории прижимаются к \mathbb{E}(X) = 3{,}5.
Дополнение. Расширение: при чём здесь страховки В лекции упоминается, что ЗБЧ «разрешил людям зарабатывать на страховках». Механика такая:
Отдельный страховой случай непредсказуем — конкретный дом либо сгорит, либо нет. Но если застраховать много независимых домов, доля сгоревших будет близка к настоящей вероятности пожара. Значит, суммарные выплаты предсказуемы, и страховщик может назначить премию чуть выше ожидаемых выплат и стабильно зарабатывать.
Ключевое условие — независимость. Когда риски скоррелированы (наводнение топит сразу весь район, а ипотечные дефолты случаются одновременно), ЗБЧ не спасает. На этом, в частности, сыпались страховщики в кризис 2008 года.
3. Практический пласт
3.1. Описательные статистики сквозь призму случайности
Считать среднее, медиану и дисперсию по выборке — механическая часть. Куда важнее мысль, ради которой это всё:
Частая ошибка. Главная идея блока Описательная статистика, посчитанная по выборке, — сама случайная величина. Опросили двух дополнительных респондентов — все числа поехали.
Насколько сильно они поедут, зависит от свойств исходной величины: где-то изменения будут незначительными, а где-то — драматическими. Отсюда и вывод: чтобы делать корректные выводы, недостаточно посчитать среднее. Нужны статистические алгоритмы, которые учитывают эту случайность. Их построением займутся следующие курсы специализации.
3.2. Сбор данных: свой парсер
Данные надо откуда-то брать. В рамках курса пишется собственный парсер на Python, который собирает информацию о мемах из интернета.
3.3. EDA и визуализация
Собранные данные анализируются: разведочный анализ данных (EDA) и визуализация. Задача этого этапа — увидеть закономерности и сформулировать гипотезы о реальности. Проверять их статистическими методами будут уже дальше.
4. Как устроена подача
Теория и практика перемешаны — блоки не идут строго друг за другом. Это осознанный выбор: определение, которое сразу применили к данным, запоминается лучше изолированного.
5. Итог: что должно остаться в голове
| # | Цель недели |
|---|---|
| 1 | Знать основные определения теории вероятностей — не «слышал», а уметь применить |
| 2 | Видеть, что все они переплетены в один клубок, а не существуют по отдельности |
| 3 | Понимать, что теория не абстрактна — она напрямую сопряжена с данными |
| 4 | Понимать, зачем это дальше: следующие курсы будут постоянно возвращаться к этому клубку |
Источник: локальный конспект «1.1 Дорожная карта курса.md».
Какие два «пласта» есть в курсе и почему они идут вперемешку?
Теоретический (теория вероятностей: случайные величины, распределения, характеристики, ЦПТ и ЗБЧ) и практический (симуляции, описательные статистики, парсинг, EDA). Вперемешку — чтобы теория сразу подкреплялась данными и не воспринималась как абстракция.
О чём говорит центральная предельная теорема и зачем она нужна?
О том, что среднее большого числа независимых наблюдений распределено примерно нормально, почти независимо от распределения самих наблюдений. Нужна потому, что на ней держится большая часть статистических методов: доверительные интервалы, t-тесты и прочее. Отдельно важно знать границы её применимости.
Почему на описательные статистики нужно смотреть «сквозь призму случайности»?
Потому что они посчитаны по конкретной выборке. Другая выборка — другие числа. Статистика по выборке сама является случайной величиной, и без учёта этого выводы будут некорректными.
Как закон больших чисел связан со страховым бизнесом?
Отдельный страховой случай непредсказуем, но на большом числе **независимых** договоров доля страховых случаев стабилизируется около истинной вероятности. Это делает суммарные выплаты предсказуемыми и позволяет назначить премию с запасом. Ломается, когда риски скоррелированы.
Показано 4 из 4 карточек
Основной пример урока: таблица наблюдений, расчёт дисперсии и график квадратичного штрафа.
Эмпирическая функция распределения для выборки
Одна выборка объёма 100 при разбиении на 20 и 100 бинов.
Гистограмма и соответствующий boxplot: отдельная точка слева отмечена как возможный выброс.
Гистограмма возраста: высоты столбцов равны
Выброс
В точке
Одна выборка даёт два эмпирических приближения: гистограмму для плотности и ECDF для функции распределения. Иллюстрация создана с фиксированным seed, поэтому числа могут отличаться от кадров лекции.
На обычной шкале основная масса данных сжата у нуля. Логарифмическая шкала по вертикали делает редкие столбцы заметными.
Группировка показывает среднее для каждого жанра. В этих данных самое большое среднее у классики, но на него могут сильно влиять редкие популярные видео.
Слева показаны преобразованные значения, справа — их сравнение по жанрам. Логарифм сжимает крупные значения, но не удаляет их.
Столбиковая диаграмма показывает, какую долю таблицы занимает каждый жанр.
Динозавр, случайное облако и вытянутое облако имеют почти одинаковые средние и стандартные отклонения, но точки организованы по-разному.