Учебник Статистика для анализа данных для начинающих
Статистика — это язык, на котором данные рассказывают о реальности. Этот курс учит понимать данные, а не просто запускать формулы: вы разберёте меры центра и разброса, форму распределений, основы вероятности, нормальное и биномиальное распределения, корреляцию и метод наименьших квадратов, а в конце — доверительные интервалы, проверку гипотез, p-value и A/B-тесты. Главная фишка: все вычисления здесь делаются на стандартной библиотеке Python (модуль statistics, math, random), поэтому каждый расчётный пример можно запустить прямо в браузере, изменить числа и сразу увидеть результат. От вас нужен только базовый Python — остальное объясняется по дороге, без тяжёлой математики.
Курс «Статистика для анализа данных» состоит из 6 разделов и 23 уроков: Введение и описательная статистика, Меры разброса и форма распределения, Вероятность: основы, Распределения, Связь переменных и Статистический вывод (основы). Уроки идут по порядку — от основ к более сложным темам, в каждом есть объяснение с примерами, а в конце — вопросы для самопроверки. К урокам привязаны задачи с автоматической проверкой: прочитали тему — сразу закрепили её кодом.
Программа курса
1 Введение и описательная статистика
- Зачем статистика в анализе данных
Что такое статистика и зачем она аналитику данных: описательная и индуктивная статистика, почему среднее без контекста обманывает.
- Типы данных и шкалы измерения
Количественные и категориальные данные, четыре шкалы измерения (номинальная, порядковая, интервальная, относительная) и почему это решает, какую статистику считать.
- Выборка и генеральная совокупность
Генеральная совокупность и выборка, репрезентативность, систематическая ошибка отбора и почему случайная выборка важнее большой.
- Меры центра: среднее, медиана, мода
Среднее, медиана и мода — три меры центра: как считаются, чем отличаются, когда какую выбирать и как медиана защищает от выбросов.
- Зачем статистика в анализе данных
2 Меры разброса и форма распределения
- Размах, дисперсия и стандартное отклонение
Меры разброса: размах, дисперсия и стандартное отклонение. Интуиция «среднего отклонения от среднего» и живой расчёт по шагам на Python.
- Квартили, межквартильный размах и перцентили
Квартили Q1, Q2, Q3, межквартильный размах IQR и перцентили: что они означают, как считать через statistics.quantiles и зачем нужны.
- Выбросы и правило 1.5·IQR
Что такое выбросы, чем они опасны для анализа и как находить их формально по правилу 1.5·IQR с живым расчётом границ на Python.
- Форма распределения и асимметрия
Форма распределения на пальцах: симметрия, левый и правый хвост, асимметрия, бимодальность и связь среднего с медианой как индикатор скоса.
- Размах, дисперсия и стандартное отклонение
3 Вероятность: основы
- Что такое вероятность
Вероятность как мера шанса от 0 до 1: классическое определение, пространство событий, дополнение события и частотная интерпретация.
- Правила сложения и умножения, независимость
Как комбинировать вероятности событий: правило сложения для «или», правило умножения для «и», независимость и несовместность событий.
- Условная вероятность и теорема Байеса
Условная вероятность P(A|B), теорема Байеса и наглядный пример с медицинским тестом, где интуиция обманывает из-за редкости болезни.
- Симуляция вероятностей и закон больших чисел
Метод Монте-Карло на модуле random: оценка вероятностей перебором случайных испытаний и закон больших чисел в действии на симуляции монеты.
- Что такое вероятность
4 Распределения
- Случайная величина и равномерное распределение
Случайная величина, её распределение и ожидание, дискретный и непрерывный случай, равномерное распределение и его моделирование на random.
- Нормальное распределение и правило 68–95–99.7
Нормальное распределение и его колокол: параметры μ и σ, правило 68–95–99.7, z-оценка и почему нормальное встречается повсюду.
- Биномиальное распределение
Биномиальное распределение для числа успехов в n испытаниях: формула через сочетания, ожидание n·p и проверка теории симуляцией.
- Центральная предельная теорема на пальцах
Центральная предельная теорема: почему суммы и средние случайных величин стремятся к нормальному распределению, наглядная симуляция на random.
- Случайная величина и равномерное распределение
5 Связь переменных
- Ковариация и корреляция Пирсона
Ковариация и коэффициент корреляции Пирсона: как измерить силу и направление линейной связи между переменными, живой расчёт на списках.
- Корреляция — это не причинность
Почему сильная корреляция не доказывает причинно-следственную связь: скрытая переменная, обратная причинность и случайные совпадения с примерами.
- Линейная регрессия и метод наименьших квадратов
Простая линейная регрессия y = a·x + b и метод наименьших квадратов: как провести прямую через облако точек и предсказывать по ней значения.
- Ковариация и корреляция Пирсона
6 Статистический вывод (основы)
- Оценка параметров и доверительный интервал
Точечная и интервальная оценка параметров: стандартная ошибка среднего и идея доверительного интервала, что он значит и чего не значит.
- Проверка гипотез и p-value
Проверка гипотез на пальцах: нулевая и альтернативная гипотезы, уровень значимости, p-value — что это и чего НЕ означает.
- Ошибки I и II рода
Ошибки первого и второго рода в проверке гипотез: ложная тревога и пропуск эффекта, их связь с alpha и мощностью, аналогия с тестом и судом.
- A/B-тестирование и чек-лист аналитика
A/B-тест как практическое применение проверки гипотез: сравнение конверсий двух групп, p-value через симуляцию, типичные ошибки и чек-лист аналитика.
- Оценка параметров и доверительный интервал