Вопросы на собеседовании: аналитик данных
Учебник построен как тренажёр перед собеседованием на позицию аналитика данных. Каждый урок разбирает один-три реальных вопроса по единой схеме: сам вопрос, что за ним на самом деле проверяет интервьюер, развёрнутый ответ с примерами кода, типичные ошибки кандидатов и выжимка «как ответить кратко» — тридцатисекундный ответ, который можно произнести вслух.
Прогрессия идёт от junior к senior: от базового SQL и работы с данными через статистику к A/B-тестам, продуктовым метрикам и защите выводов перед бизнесом. SQL-примеры запускаются прямо в браузере, расчёты на Python — тоже.
Курс «Вопросы на собеседовании: аналитик данных» состоит из 5 разделов и 15 уроков: SQL на собеседовании, Работа с данными, Статистика для аналитика, A/B-тесты и эксперименты и Продуктовая аналитика и коммуникация. Уроки идут по порядку — от основ к более сложным темам, в каждом есть объяснение с примерами, а в конце — вопросы для самопроверки. К урокам привязаны задачи с автоматической проверкой: прочитали тему — сразу закрепили её кодом.
Программа курса
1 SQL на собеседовании
- JOIN: чем INNER отличается от LEFT и где теряются данные
Вопрос с собеседования аналитика: разница INNER JOIN и LEFT JOIN на живых данных, ловушка с условием в WHERE вместо ON и почему COUNT(*) врёт после LEFT JOIN.
- GROUP BY, HAVING и WHERE: порядок выполнения запроса
Чем HAVING отличается от WHERE, в каком порядке выполняется SQL-запрос, что можно класть в SELECT при GROUP BY и почему AVG игнорирует NULL — с примерами.
- Подзапросы, CTE и оконные функции: задача «топ-N в группе»
Разница между подзапросом и CTE, вред коррелированных подзапросов и решение классической задачи собеседования «лучший менеджер в каждом городе» через ROW_NUMBER и RANK.
- JOIN: чем INNER отличается от LEFT и где теряются данные
2 Работа с данными
- Типы данных и качество данных
Как ответить на вопрос «как вы проверяете качество данных»: шкалы измерения, шесть измерений качества и готовый SQL-профиль таблицы с проверкой дублей, NULL и диапазонов.
- Пропуски и выбросы: что с ними делать
Механизмы пропусков MCAR, MAR и MNAR, восемь способов обработки NULL, поиск выбросов через IQR против правила трёх сигм и когда выброс удалять нельзя.
- Нормализация, витрины и ETL
Нормальные формы против денормализации, отличие OLTP от OLAP, схема «звезда» с фактами и измерениями, слои хранилища, ETL против ELT и SCD Type 2.
- Типы данных и качество данных
3 Статистика для аналитика
- Среднее, медиана и перцентили: что когда брать
Почему средняя зарплата вводит в заблуждение: устойчивость медианы, перцентили p95 и p99 для метрик скорости, признак скошенного распределения и ловушка бимодальности.
- Дисперсия, стандартное отклонение и распределения
Что такое дисперсия и стандартное отклонение, зачем в знаменателе n−1, коэффициент вариации, ключевые распределения аналитика и центральная предельная теорема.
- Корреляция, причинность и доверительные интервалы
Почему корреляция не доказывает причинность: конфаундеры, обратная причинность, ошибка выжившего. И доверительный интервал простыми словами с расчётом ширины по размеру выборки.
- Среднее, медиана и перцентили: что когда брать
4 A/B-тесты и эксперименты
- Как устроен A/B-тест: от гипотезы до решения
Разбор вопроса «как бы вы запустили A/B-тест»: гипотеза, целевая метрика и гардрейлы, MDE, выбор единицы рандомизации, A/A-проверка и диагностика SRM с примером расчёта.
- Гипотезы, p-value и ошибки первого и второго рода
Что такое p-value на самом деле и чем оно не является, расчёт z-теста для двух конверсий, различие ошибок I и II рода и обмен между α и β.
- Размер выборки, мощность и подводные камни
Расчёт размера выборки через MDE и мощность, почему подглядывание в результаты поднимает долю ложных выводов, множественные сравнения, парадокс Симпсона и сетевые эффекты.
- Как устроен A/B-тест: от гипотезы до решения
5 Продуктовая аналитика и коммуникация
- Метрики продукта: DAU, retention и воронка
DAU, MAU и sticky factor, когортный retention и три его вида, расчёт конверсии воронки на SQL по уникальным пользователям и подвохи с окном конверсии.
- LTV, юнит-экономика и выбор метрики
Как считать CAC и LTV, почему ориентир LTV/CAC равен трём, срок окупаемости привлечения, ограничения расчёта LTV и как выбрать North Star Metric с контрметриками.
- Визуализация, защита выводов и разбор кейса
Как выбирать тип графика и не врать осью Y, структура «пирамиды» для защиты вывода перед бизнесом и пошаговый разбор кейса «конверсия упала на 15%».
- Метрики продукта: DAU, retention и воронка