AI и машинное обучение

Учебник MLOps для начинающих

27 уроков · 8 разделов · бесплатно, без регистрации

Практический курс о том, как вывести машинное обучение из ноутбука в надёжный продакшн. Разбираем жизненный цикл ML-системы, версионирование данных и моделей (DVC, реестр), отслеживание экспериментов (MLflow), feature store, CI/CD для ML, упаковку и развёртывание моделей, масштабирование инференса, мониторинг, обнаружение дрейфа, переобучение, безопасные релизы (канарейка, shadow, rollback), оркестрацию пайплайнов, инфраструктуру и LLMOps. Для тех, кто умеет обучать модели и хочет научиться их эксплуатировать.

Курс «MLOps: машинное обучение в продакшн» состоит из 8 разделов и 27 уроков: Введение в MLOps, Версионирование и эксперименты, Признаки и воспроизводимость, CI/CD и упаковка модели, Развёртывание и сервинг, Мониторинг и дрейф, Релизы и переобучение и Оркестрация, инфраструктура и LLMOps. Уроки идут по порядку — от основ к более сложным темам, в каждом есть объяснение с примерами, а в конце — вопросы для самопроверки. К урокам привязаны задачи с автоматической проверкой: прочитали тему — сразу закрепили её кодом.

Программа курса

  1. 1 Введение в MLOps

    1. Что такое MLOps и зачем он нужен

      MLOps — это практики надёжной доставки ML-моделей в продакшн: разрыв между ноутбуком и проде, ML-долг и роль автоматизации.

    2. Жизненный цикл ML-системы

      Этапы ML-системы: данные, обучение, валидация, деплой, мониторинг и переобучение — как они образуют замкнутый цикл.

    3. Уровни зрелости MLOps

      Три уровня зрелости MLOps по Google: ручной процесс, автоматизация пайплайна обучения и полный CI/CD/CT — как понять, где вы.

  2. 2 Версионирование и эксперименты

    1. Версионирование данных с DVC

      DVC версионирует данные и модели поверх git: как работает .dvc-указатель, удалённое хранилище и связь данных с коммитом.

    2. Реестр моделей (Model Registry)

      Реестр моделей: версии, стадии (Staging/Production), метаданные и переходы — как централизованно управлять жизненным циклом моделей.

    3. Отслеживание экспериментов в MLflow

      MLflow Tracking: runs, параметры, метрики, артефакты и теги — как сделать эксперименты воспроизводимыми и сравнимыми.

  3. 3 Признаки и воспроизводимость

    1. Feature store: зачем и как

      Feature store централизует признаки: офлайн- и онлайн-хранилища, переиспользование и единая логика для обучения и инференса.

    2. Training-serving skew

      Training-serving skew: почему модель работает на обучении, но проседает в проде, и как обнаружить рассинхрон признаков.

    3. Воспроизводимость: seed, окружение, lineage

      Воспроизводимость в ML: фиксация seed, версий пакетов и окружения, отслеживание происхождения (lineage) артефактов.

  4. 4 CI/CD и упаковка модели

    1. CI/CD для ML: чем отличается

      CI/CD для ML: к обычному конвейеру добавляются CT (continuous training) и проверки данных и качества модели.

    2. Тесты данных и моделей

      Как тестировать данные (схема, диапазоны, пропуски) и модели (метрики, инварианты, срезы) в ML-пайплайне.

    3. Упаковка модели в Docker-образ

      Упаковка модели: сериализация, фиксация зависимостей и Docker-образ — как получить переносимый воспроизводимый артефакт.

  5. 5 Развёртывание и сервинг

    1. Способы развёртывания моделей

      Четыре паттерна развёртывания модели: онлайн REST API, батч, стриминг и edge — когда какой выбрать.

    2. Обзор serving-инструментов

      Обзор инструментов сервинга: FastAPI, BentoML, Triton, TF Serving — их ниши и когда какой выбрать.

    3. Инференс-сервис на FastAPI

      Как устроен инференс-эндпоинт на FastAPI: загрузка модели при старте, валидация запроса, predict и health-check.

    4. Масштабирование инференса

      Масштабирование инференса: батчинг запросов, горизонтальный автоскейлинг и эффективное использование GPU.

  6. 6 Мониторинг и дрейф

    1. Мониторинг моделей в продакшне

      Три уровня мониторинга ML-модели: операционный, по данным и по качеству предсказаний — что и зачем измерять.

    2. Дрейф данных: KS-тест и PSI

      Как статистически обнаружить дрейф данных: KS-тест и PSI (Population Stability Index) — расчёт и интерпретация.

    3. Концепт-дрейф

      Концепт-дрейф: изменение связи между признаками и целью; чем отличается от дрейфа данных и как его обнаружить.

    4. Что логировать в проде

      Что логировать для ML-сервиса: вход, предсказание, версию модели, латентность и метаданные — для дебага, аудита и дрейфа.

  7. 7 Релизы и переобучение

    1. A/B-тесты и канареечный деплой

      Безопасный выкат модели: канареечный деплой (доля трафика) и A/B-тест (статистическое сравнение версий на метрике бизнеса).

    2. Rollback и shadow-деплой

      Rollback (быстрый откат к прошлой версии) и shadow-деплой (теневой прогон новой модели без влияния на ответы).

    3. Переобучение: триггеры и человек в цикле

      Переобучение моделей: триггеры (расписание, дрейф, падение качества), автоматизация и роль человека в цикле.

  8. 8 Оркестрация, инфраструктура и LLMOps

    1. Оркестрация пайплайнов

      Оркестраторы ML-пайплайнов: Airflow, Kubeflow и Prefect — что такое DAG, зачем оркестрация и когда какой выбрать.

    2. Инфраструктура и управление для ML

      Инфраструктура ML: облако и Kubernetes, GPU-ресурсы, IaC, а также governance — управление доступом, аудит и воспроизводимость.

    3. LLMOps: специфика LLM в проде

      LLMOps: чем эксплуатация больших языковых моделей отличается от классического MLOps — промпты, RAG, оценка, стоимость, галлюцинации.

    4. Типичные ошибки MLOps

      Разбор частых провалов MLOps: training-serving skew, отсутствие мониторинга, ручной деплой, нет воспроизводимости и версионирования.