Data Science и аналитика

Учебник Статистика для анализа данных для начинающих

23 урока · 6 разделов · бесплатно, без регистрации

Статистика — это язык, на котором данные рассказывают о реальности. Этот курс учит понимать данные, а не просто запускать формулы: вы разберёте меры центра и разброса, форму распределений, основы вероятности, нормальное и биномиальное распределения, корреляцию и метод наименьших квадратов, а в конце — доверительные интервалы, проверку гипотез, p-value и A/B-тесты. Главная фишка: все вычисления здесь делаются на стандартной библиотеке Python (модуль statistics, math, random), поэтому каждый расчётный пример можно запустить прямо в браузере, изменить числа и сразу увидеть результат. От вас нужен только базовый Python — остальное объясняется по дороге, без тяжёлой математики.

Курс «Статистика для анализа данных» состоит из 6 разделов и 23 уроков: Введение и описательная статистика, Меры разброса и форма распределения, Вероятность: основы, Распределения, Связь переменных и Статистический вывод (основы). Уроки идут по порядку — от основ к более сложным темам, в каждом есть объяснение с примерами, а в конце — вопросы для самопроверки. К урокам привязаны задачи с автоматической проверкой: прочитали тему — сразу закрепили её кодом.

Программа курса

  1. 1 Введение и описательная статистика

    1. Зачем статистика в анализе данных

      Что такое статистика и зачем она аналитику данных: описательная и индуктивная статистика, почему среднее без контекста обманывает.

    2. Типы данных и шкалы измерения

      Количественные и категориальные данные, четыре шкалы измерения (номинальная, порядковая, интервальная, относительная) и почему это решает, какую статистику считать.

    3. Выборка и генеральная совокупность

      Генеральная совокупность и выборка, репрезентативность, систематическая ошибка отбора и почему случайная выборка важнее большой.

    4. Меры центра: среднее, медиана, мода

      Среднее, медиана и мода — три меры центра: как считаются, чем отличаются, когда какую выбирать и как медиана защищает от выбросов.

  2. 2 Меры разброса и форма распределения

    1. Размах, дисперсия и стандартное отклонение

      Меры разброса: размах, дисперсия и стандартное отклонение. Интуиция «среднего отклонения от среднего» и живой расчёт по шагам на Python.

    2. Квартили, межквартильный размах и перцентили

      Квартили Q1, Q2, Q3, межквартильный размах IQR и перцентили: что они означают, как считать через statistics.quantiles и зачем нужны.

    3. Выбросы и правило 1.5·IQR

      Что такое выбросы, чем они опасны для анализа и как находить их формально по правилу 1.5·IQR с живым расчётом границ на Python.

    4. Форма распределения и асимметрия

      Форма распределения на пальцах: симметрия, левый и правый хвост, асимметрия, бимодальность и связь среднего с медианой как индикатор скоса.

  3. 3 Вероятность: основы

    1. Что такое вероятность

      Вероятность как мера шанса от 0 до 1: классическое определение, пространство событий, дополнение события и частотная интерпретация.

    2. Правила сложения и умножения, независимость

      Как комбинировать вероятности событий: правило сложения для «или», правило умножения для «и», независимость и несовместность событий.

    3. Условная вероятность и теорема Байеса

      Условная вероятность P(A|B), теорема Байеса и наглядный пример с медицинским тестом, где интуиция обманывает из-за редкости болезни.

    4. Симуляция вероятностей и закон больших чисел

      Метод Монте-Карло на модуле random: оценка вероятностей перебором случайных испытаний и закон больших чисел в действии на симуляции монеты.

  4. 4 Распределения

    1. Случайная величина и равномерное распределение

      Случайная величина, её распределение и ожидание, дискретный и непрерывный случай, равномерное распределение и его моделирование на random.

    2. Нормальное распределение и правило 68–95–99.7

      Нормальное распределение и его колокол: параметры μ и σ, правило 68–95–99.7, z-оценка и почему нормальное встречается повсюду.

    3. Биномиальное распределение

      Биномиальное распределение для числа успехов в n испытаниях: формула через сочетания, ожидание n·p и проверка теории симуляцией.

    4. Центральная предельная теорема на пальцах

      Центральная предельная теорема: почему суммы и средние случайных величин стремятся к нормальному распределению, наглядная симуляция на random.

  5. 5 Связь переменных

    1. Ковариация и корреляция Пирсона

      Ковариация и коэффициент корреляции Пирсона: как измерить силу и направление линейной связи между переменными, живой расчёт на списках.

    2. Корреляция — это не причинность

      Почему сильная корреляция не доказывает причинно-следственную связь: скрытая переменная, обратная причинность и случайные совпадения с примерами.

    3. Линейная регрессия и метод наименьших квадратов

      Простая линейная регрессия y = a·x + b и метод наименьших квадратов: как провести прямую через облако точек и предсказывать по ней значения.

  6. 6 Статистический вывод (основы)

    1. Оценка параметров и доверительный интервал

      Точечная и интервальная оценка параметров: стандартная ошибка среднего и идея доверительного интервала, что он значит и чего не значит.

    2. Проверка гипотез и p-value

      Проверка гипотез на пальцах: нулевая и альтернативная гипотезы, уровень значимости, p-value — что это и чего НЕ означает.

    3. Ошибки I и II рода

      Ошибки первого и второго рода в проверке гипотез: ложная тревога и пропуск эффекта, их связь с alpha и мощностью, аналогия с тестом и судом.

    4. A/B-тестирование и чек-лист аналитика

      A/B-тест как практическое применение проверки гипотез: сравнение конверсий двух групп, p-value через симуляцию, типичные ошибки и чек-лист аналитика.