AI и машинное обучение

Учебник Hugging Face и Transformers для начинающих

22 урока · 6 разделов · бесплатно, без регистрации

Hugging Face — это центр современной open-source экосистемы машинного обучения. Здесь живут сотни тысяч предобученных моделей, тысячи датасетов и удобные библиотеки, которые превращают сложную работу с нейросетями в несколько строк кода. В этом курсе вы разберётесь, как устроен Hugging Face Hub, научитесь запускать готовые модели через pipeline(), поймёте, что такое токенизаторы и трансформеры, освоите дообучение моделей через Trainer API, работу с датасетами, эмбеддинги для семантического поиска, диффузионные модели и публикацию своих моделей. Курс рассчитан на тех, кто уже знает Python и хочет перейти от теории нейросетей к практическому применению. Мы свяжем материал с курсами по LLM, NLP, PyTorch, глубокому обучению и Stable Diffusion, чтобы вы видели цельную картину.

Курс «Hugging Face и Transformers» состоит из 6 разделов и 22 уроков: Знакомство с Hugging Face, Pipeline и токенизаторы, Спецтокены и модели, Датасеты, инференс и дообучение, Публикация, оптимизация и эмбеддинги и Диффузия, демо и ответственность. Уроки идут по порядку — от основ к более сложным темам, в каждом есть объяснение с примерами, а в конце — вопросы для самопроверки. К урокам привязаны задачи с автоматической проверкой: прочитали тему — сразу закрепили её кодом.

Программа курса

  1. 1 Знакомство с Hugging Face

    1. Экосистема Hugging Face: зачем она нужна

      Что такое Hugging Face, какие библиотеки и сервисы входят в экосистему и какую проблему они решают для ML-разработчика.

    2. Hub: модели, датасеты и Spaces

      Как устроен Hugging Face Hub: карточки моделей, фильтры по задачам, датасеты и интерактивные демо Spaces.

    3. Предобученные модели и трансфер-обучение

      Что такое предобученная модель и трансфер-обучение, почему дообучение дешевле обучения с нуля.

    4. pipeline(): самый быстрый способ применить модель

      Как устроена функция pipeline() в transformers и почему это самый быстрый способ запустить готовую модель.

  2. 2 Pipeline и токенизаторы

    1. Задачи pipeline: тональность, NER, генерация

      Обзор частых задач pipeline(): анализ тональности, распознавание сущностей (NER) и генерация текста.

    2. Перевод и ответы на вопросы

      Задачи pipeline для перевода (translation) и ответов на вопросы по контексту (question-answering).

    3. Что делает токенизатор

      Зачем нужен токенизатор, как текст превращается в числа (input_ids) и почему модель не работает со словами напрямую.

    4. Subword и BPE

      Как работает subword-токенизация и алгоритм BPE: дробление редких слов на части и борьба с неизвестными словами.

  3. 3 Спецтокены и модели

    1. Специальные токены

      Что такое специальные токены CLS, SEP, PAD, UNK, BOS, EOS и зачем модели нужны эти служебные метки.

    2. AutoModel и AutoTokenizer

      Универсальные классы AutoModel и AutoTokenizer: как загрузить любую модель и токенизатор по одному идентификатору.

    3. Архитектура трансформера и attention

      Краткое устройство трансформера и механизма внимания (attention) — основы современных языковых моделей.

    4. Encoder, decoder и encoder-decoder

      Три семейства трансформеров: encoder (BERT), decoder (GPT) и encoder-decoder (T5) — чем отличаются и для чего.

  4. 4 Датасеты, инференс и дообучение

    1. Работа с датасетами: load_dataset и map

      Библиотека datasets: загрузка наборов данных через load_dataset и эффективная обработка через map.

    2. Инференс: от входа к ответу

      Как происходит инференс модели: текст в input_ids, прогон, логиты, softmax и финальный ответ.

    3. Дообучение с Trainer API

      Как дообучить модель через Trainer API: TrainingArguments, датасет, цикл обучения без ручного кода.

    4. Метрики и оценка качества

      Как оценивать модель: accuracy, precision, recall, F1 и почему точности недостаточно при дисбалансе классов.

  5. 5 Публикация, оптимизация и эмбеддинги

    1. Публикация модели на Hub

      Как загрузить свою модель на Hugging Face Hub: push_to_hub, карточка модели и версионирование.

    2. Квантизация и оптимизация инференса

      Обзор квантизации и способов ускорить инференс: int8/4-bit, уменьшение памяти, дистилляция и батчинг.

    3. Sentence Transformers и эмбеддинги

      Эмбеддинги предложений через Sentence Transformers: семантический поиск, косинусная близость и связь с RAG.

  6. 6 Диффузия, демо и ответственность

    1. Диффузионные модели через diffusers

      Обзор библиотеки diffusers и диффузионных моделей: как из шума рождается изображение, связь со Stable Diffusion.

    2. Spaces и Gradio: демо за минуты

      Как собрать интерактивное демо модели на Gradio и опубликовать его в Hugging Face Spaces.

    3. Этика, лицензии и локальный запуск против API

      Ответственное использование моделей: лицензии, ограничения, предвзятость, а также выбор между локальным запуском и API.

py
Курс по теме
Пройдите курс «Python с нуля» — по шагам, с проверкой
8 уроков · ~14 ч · теория, упражнения и экзамен с бейджем
Открыть курс →