Data Science и аналитика

Вопросы на собеседовании: аналитик данных

15 уроков · 5 разделов · бесплатно, без регистрации

Учебник построен как тренажёр перед собеседованием на позицию аналитика данных. Каждый урок разбирает один-три реальных вопроса по единой схеме: сам вопрос, что за ним на самом деле проверяет интервьюер, развёрнутый ответ с примерами кода, типичные ошибки кандидатов и выжимка «как ответить кратко» — тридцатисекундный ответ, который можно произнести вслух.

Прогрессия идёт от junior к senior: от базового SQL и работы с данными через статистику к A/B-тестам, продуктовым метрикам и защите выводов перед бизнесом. SQL-примеры запускаются прямо в браузере, расчёты на Python — тоже.

Курс «Вопросы на собеседовании: аналитик данных» состоит из 5 разделов и 15 уроков: SQL на собеседовании, Работа с данными, Статистика для аналитика, A/B-тесты и эксперименты и Продуктовая аналитика и коммуникация. Уроки идут по порядку — от основ к более сложным темам, в каждом есть объяснение с примерами, а в конце — вопросы для самопроверки. К урокам привязаны задачи с автоматической проверкой: прочитали тему — сразу закрепили её кодом.

Программа курса

  1. 1 SQL на собеседовании

    1. JOIN: чем INNER отличается от LEFT и где теряются данные

      Вопрос с собеседования аналитика: разница INNER JOIN и LEFT JOIN на живых данных, ловушка с условием в WHERE вместо ON и почему COUNT(*) врёт после LEFT JOIN.

    2. GROUP BY, HAVING и WHERE: порядок выполнения запроса

      Чем HAVING отличается от WHERE, в каком порядке выполняется SQL-запрос, что можно класть в SELECT при GROUP BY и почему AVG игнорирует NULL — с примерами.

    3. Подзапросы, CTE и оконные функции: задача «топ-N в группе»

      Разница между подзапросом и CTE, вред коррелированных подзапросов и решение классической задачи собеседования «лучший менеджер в каждом городе» через ROW_NUMBER и RANK.

  2. 2 Работа с данными

    1. Типы данных и качество данных

      Как ответить на вопрос «как вы проверяете качество данных»: шкалы измерения, шесть измерений качества и готовый SQL-профиль таблицы с проверкой дублей, NULL и диапазонов.

    2. Пропуски и выбросы: что с ними делать

      Механизмы пропусков MCAR, MAR и MNAR, восемь способов обработки NULL, поиск выбросов через IQR против правила трёх сигм и когда выброс удалять нельзя.

    3. Нормализация, витрины и ETL

      Нормальные формы против денормализации, отличие OLTP от OLAP, схема «звезда» с фактами и измерениями, слои хранилища, ETL против ELT и SCD Type 2.

  3. 3 Статистика для аналитика

    1. Среднее, медиана и перцентили: что когда брать

      Почему средняя зарплата вводит в заблуждение: устойчивость медианы, перцентили p95 и p99 для метрик скорости, признак скошенного распределения и ловушка бимодальности.

    2. Дисперсия, стандартное отклонение и распределения

      Что такое дисперсия и стандартное отклонение, зачем в знаменателе n−1, коэффициент вариации, ключевые распределения аналитика и центральная предельная теорема.

    3. Корреляция, причинность и доверительные интервалы

      Почему корреляция не доказывает причинность: конфаундеры, обратная причинность, ошибка выжившего. И доверительный интервал простыми словами с расчётом ширины по размеру выборки.

  4. 4 A/B-тесты и эксперименты

    1. Как устроен A/B-тест: от гипотезы до решения

      Разбор вопроса «как бы вы запустили A/B-тест»: гипотеза, целевая метрика и гардрейлы, MDE, выбор единицы рандомизации, A/A-проверка и диагностика SRM с примером расчёта.

    2. Гипотезы, p-value и ошибки первого и второго рода

      Что такое p-value на самом деле и чем оно не является, расчёт z-теста для двух конверсий, различие ошибок I и II рода и обмен между α и β.

    3. Размер выборки, мощность и подводные камни

      Расчёт размера выборки через MDE и мощность, почему подглядывание в результаты поднимает долю ложных выводов, множественные сравнения, парадокс Симпсона и сетевые эффекты.

  5. 5 Продуктовая аналитика и коммуникация

    1. Метрики продукта: DAU, retention и воронка

      DAU, MAU и sticky factor, когортный retention и три его вида, расчёт конверсии воронки на SQL по уникальным пользователям и подвохи с окном конверсии.

    2. LTV, юнит-экономика и выбор метрики

      Как считать CAC и LTV, почему ориентир LTV/CAC равен трём, срок окупаемости привлечения, ограничения расчёта LTV и как выбрать North Star Metric с контрметриками.

    3. Визуализация, защита выводов и разбор кейса

      Как выбирать тип графика и не врать осью Y, структура «пирамиды» для защиты вывода перед бизнесом и пошаговый разбор кейса «конверсия упала на 15%».