AI и машинное обучение

Учебник Машинное обучение для начинающих

25 уроков · 6 разделов · бесплатно, без регистрации

Машинное обучение — это способ научить программу решать задачу не по жёстким правилам, которые написал человек, а на основе примеров из данных. Этот курс знакомит с основами ML с нуля: вы поймёте, чем обучение на данных отличается от обычного программирования, разберёте задачи регрессии и классификации, заглянете в обучение без учителя, научитесь видеть переобучение и оценивать качество моделей метриками, а в конце построите мост к нейросетям, глубокому обучению и большим языковым моделям. Математики — минимум, только самое нужное и всегда с объяснением «на пальцах». Нужен лишь базовый Python: часть примеров вы сможете запустить прямо в браузере.

Курс «Машинное обучение: основы» состоит из 6 разделов и 25 уроков: Что такое машинное обучение, Обучение с учителем: регрессия, Обучение с учителем: классификация, Обучение без учителя, Данные и обобщающая способность и Оценка моделей и современный AI. Уроки идут по порядку — от основ к более сложным темам, в каждом есть объяснение с примерами, а в конце — вопросы для самопроверки. К урокам привязаны задачи с автоматической проверкой: прочитали тему — сразу закрепили её кодом.

Программа курса

  1. 1 Что такое машинное обучение

    1. Чем ML отличается от обычного программирования

      Главное отличие машинного обучения от классического кода: вместо правил, написанных человеком, программа находит закономерности в данных сама.

    2. Где применяется машинное обучение

      Примеры ML из повседневной жизни: рекомендации, распознавание речи и лиц, антифрод, медицина, перевод — и что у них общего.

    3. Типы задач: с учителем, без учителя, с подкреплением

      Обзор трёх главных видов машинного обучения: обучение с учителем, без учителя и с подкреплением — в чём разница и когда какой нужен.

    4. Базовая терминология ML

      Признаки, метки, датасет, модель, обучение и инференс — словарь начинающего, без которого дальше не разобраться.

  2. 2 Обучение с учителем: регрессия

    1. Регрессия: предсказываем число

      Что такое задача регрессии в ML: когда нужно предсказать число, чем она отличается от классификации и какие бывают примеры.

    2. Линейная регрессия на пальцах

      Как устроена линейная регрессия: уравнение прямой y = kx + b, наклон и сдвиг, и почему через облако точек проводят именно линию.

    3. Функция потерь и MSE

      Что такое функция потерь, как среднеквадратичная ошибка (MSE) измеряет качество регрессии, и как посчитать MSE на обычном Python.

    4. Регрессия в scikit-learn

      Как линейная регрессия выглядит на практике в библиотеке scikit-learn: шаблон fit/predict, коэффициенты модели и оценка качества.

  3. 3 Обучение с учителем: классификация

    1. Классификация: предсказываем класс

      Что такое классификация в ML: предсказание категории, бинарные и многоклассовые задачи, реальные примеры — спам, диагноз, распознавание.

    2. Граница решения

      Что такое граница решения в классификации: как модель делит пространство признаков на области классов и почему граница бывает прямой и кривой.

    3. Обзор алгоритмов классификации

      Краткий и наглядный обзор главных алгоритмов классификации: kNN, логистическая регрессия и деревья решений — как они работают и когда их выбирать.

    4. kNN на пальцах

      Метод ближайших соседей kNN своими руками на чистом Python: считаем расстояния, находим соседей и голосуем за класс.

  4. 4 Обучение без учителя

    1. Обучение без учителя: когда нет меток

      Что такое обучение без учителя: задачи, где у данных нет правильных ответов, и как модель ищет в них скрытую структуру.

    2. Кластеризация и k-means

      Как работает кластеризация методом k-means: центроиды, шаг присвоения и шаг пересчёта — наглядно и на чистом Python.

    3. Понижение размерности и PCA

      Зачем понижать размерность данных и как метод главных компонент (PCA) сжимает много признаков в несколько, сохраняя суть.

  5. 5 Данные и обобщающая способность

    1. Почему данные важнее алгоритма

      Почему в машинном обучении качество данных важнее выбора алгоритма: мусор на входе — мусор на выходе, смещения и роль подготовки данных.

    2. Подготовка признаков

      Базовая подготовка данных для ML: нормализация числовых признаков и кодирование категорий, зачем это нужно и как сделать на Python.

    3. Train/test split: проверяем честно

      Зачем делить данные на обучающую и тестовую выборки: модель надо проверять на примерах, которых она не видела при обучении.

    4. Переобучение и недообучение

      Ключевая тема ML: что такое переобучение (overfitting) и недообучение (underfitting), как их распознать по ошибке на train и test и как бороться.

    5. Кросс-валидация

      Что такое кросс-валидация и зачем она нужна: как надёжно оценить модель, по очереди используя разные части данных как тест.

  6. 6 Оценка моделей и современный AI

    1. Метрики классификации: accuracy, precision, recall, F1

      Метрики качества классификации: accuracy, precision, recall и F1 с интуицией, матрицей ошибок и расчётом на чистом Python.

    2. Метрики регрессии: MAE и RMSE

      Метрики качества регрессии: средняя абсолютная ошибка MAE и корень из среднеквадратичной RMSE — в чём разница и как считать.

    3. От нейрона к нейросетям

      Что такое искусственный нейрон и перцептрон: взвешенная сумма, порог активации и как из нейронов собирают нейронные сети.

    4. Глубокое обучение и большие языковые модели

      Что такое глубокое обучение (deep learning), почему оно изменило AI, и очень кратко — что такое большие языковые модели (LLM) и в чём их прорыв.

    5. Карта: куда двигаться дальше

      Итоговая карта курса по основам ML и маршрут развития: какие инструменты освоить, какие темы изучать и как практиковаться.