Учебник Машинное обучение для начинающих
Машинное обучение — это способ научить программу решать задачу не по жёстким правилам, которые написал человек, а на основе примеров из данных. Этот курс знакомит с основами ML с нуля: вы поймёте, чем обучение на данных отличается от обычного программирования, разберёте задачи регрессии и классификации, заглянете в обучение без учителя, научитесь видеть переобучение и оценивать качество моделей метриками, а в конце построите мост к нейросетям, глубокому обучению и большим языковым моделям. Математики — минимум, только самое нужное и всегда с объяснением «на пальцах». Нужен лишь базовый Python: часть примеров вы сможете запустить прямо в браузере.
Курс «Машинное обучение: основы» состоит из 6 разделов и 25 уроков: Что такое машинное обучение, Обучение с учителем: регрессия, Обучение с учителем: классификация, Обучение без учителя, Данные и обобщающая способность и Оценка моделей и современный AI. Уроки идут по порядку — от основ к более сложным темам, в каждом есть объяснение с примерами, а в конце — вопросы для самопроверки. К урокам привязаны задачи с автоматической проверкой: прочитали тему — сразу закрепили её кодом.
Программа курса
1 Что такое машинное обучение
- Чем ML отличается от обычного программирования
Главное отличие машинного обучения от классического кода: вместо правил, написанных человеком, программа находит закономерности в данных сама.
- Где применяется машинное обучение
Примеры ML из повседневной жизни: рекомендации, распознавание речи и лиц, антифрод, медицина, перевод — и что у них общего.
- Типы задач: с учителем, без учителя, с подкреплением
Обзор трёх главных видов машинного обучения: обучение с учителем, без учителя и с подкреплением — в чём разница и когда какой нужен.
- Базовая терминология ML
Признаки, метки, датасет, модель, обучение и инференс — словарь начинающего, без которого дальше не разобраться.
- Чем ML отличается от обычного программирования
2 Обучение с учителем: регрессия
- Регрессия: предсказываем число
Что такое задача регрессии в ML: когда нужно предсказать число, чем она отличается от классификации и какие бывают примеры.
- Линейная регрессия на пальцах
Как устроена линейная регрессия: уравнение прямой y = kx + b, наклон и сдвиг, и почему через облако точек проводят именно линию.
- Функция потерь и MSE
Что такое функция потерь, как среднеквадратичная ошибка (MSE) измеряет качество регрессии, и как посчитать MSE на обычном Python.
- Регрессия в scikit-learn
Как линейная регрессия выглядит на практике в библиотеке scikit-learn: шаблон fit/predict, коэффициенты модели и оценка качества.
- Регрессия: предсказываем число
3 Обучение с учителем: классификация
- Классификация: предсказываем класс
Что такое классификация в ML: предсказание категории, бинарные и многоклассовые задачи, реальные примеры — спам, диагноз, распознавание.
- Граница решения
Что такое граница решения в классификации: как модель делит пространство признаков на области классов и почему граница бывает прямой и кривой.
- Обзор алгоритмов классификации
Краткий и наглядный обзор главных алгоритмов классификации: kNN, логистическая регрессия и деревья решений — как они работают и когда их выбирать.
- kNN на пальцах
Метод ближайших соседей kNN своими руками на чистом Python: считаем расстояния, находим соседей и голосуем за класс.
- Классификация: предсказываем класс
4 Обучение без учителя
- Обучение без учителя: когда нет меток
Что такое обучение без учителя: задачи, где у данных нет правильных ответов, и как модель ищет в них скрытую структуру.
- Кластеризация и k-means
Как работает кластеризация методом k-means: центроиды, шаг присвоения и шаг пересчёта — наглядно и на чистом Python.
- Понижение размерности и PCA
Зачем понижать размерность данных и как метод главных компонент (PCA) сжимает много признаков в несколько, сохраняя суть.
- Обучение без учителя: когда нет меток
5 Данные и обобщающая способность
- Почему данные важнее алгоритма
Почему в машинном обучении качество данных важнее выбора алгоритма: мусор на входе — мусор на выходе, смещения и роль подготовки данных.
- Подготовка признаков
Базовая подготовка данных для ML: нормализация числовых признаков и кодирование категорий, зачем это нужно и как сделать на Python.
- Train/test split: проверяем честно
Зачем делить данные на обучающую и тестовую выборки: модель надо проверять на примерах, которых она не видела при обучении.
- Переобучение и недообучение
Ключевая тема ML: что такое переобучение (overfitting) и недообучение (underfitting), как их распознать по ошибке на train и test и как бороться.
- Кросс-валидация
Что такое кросс-валидация и зачем она нужна: как надёжно оценить модель, по очереди используя разные части данных как тест.
- Почему данные важнее алгоритма
6 Оценка моделей и современный AI
- Метрики классификации: accuracy, precision, recall, F1
Метрики качества классификации: accuracy, precision, recall и F1 с интуицией, матрицей ошибок и расчётом на чистом Python.
- Метрики регрессии: MAE и RMSE
Метрики качества регрессии: средняя абсолютная ошибка MAE и корень из среднеквадратичной RMSE — в чём разница и как считать.
- От нейрона к нейросетям
Что такое искусственный нейрон и перцептрон: взвешенная сумма, порог активации и как из нейронов собирают нейронные сети.
- Глубокое обучение и большие языковые модели
Что такое глубокое обучение (deep learning), почему оно изменило AI, и очень кратко — что такое большие языковые модели (LLM) и в чём их прорыв.
- Карта: куда двигаться дальше
Итоговая карта курса по основам ML и маршрут развития: какие инструменты освоить, какие темы изучать и как практиковаться.
- Метрики классификации: accuracy, precision, recall, F1