AI и машинное обучение

Учебник Генеративный AI для начинающих

22 урока · 6 разделов · бесплатно, без регистрации

Этот курс объясняет, как нейросети создают изображения «из текста» — на примере Stable Diffusion и других диффузионных моделей. Вы пройдёте путь от интуиции (что такое генеративный AI и чем он отличается от распознавания) до практики: как устроен прямой и обратный процесс диффузии, из каких блоков собран Stable Diffusion (U-Net, VAE, текстовый энкодер CLIP), как писать промпты и подбирать параметры (steps, CFG scale, seed, sampler), что такое img2img, inpainting и ControlNet. Отдельный большой раздел — этика и право: авторские данные, дипфейки, водяные знаки и честное использование. Курс для тех, кто хочет понимать происходящее «под капотом», а не просто нажимать кнопки. Связан с нашими курсами «Как работает AI и ChatGPT», «Глубокое обучение» и «Компьютерное зрение».

Курс «Генеративный AI: Stable Diffusion» состоит из 6 разделов и 22 уроков: Основы: генеративный AI и изображения, Интуиция диффузии, Архитектура Stable Diffusion, Текст в картинку: промпты и параметры, Продвинутые техники и инструменты и Этика и право. Уроки идут по порядку — от основ к более сложным темам, в каждом есть объяснение с примерами, а в конце — вопросы для самопроверки. К урокам привязаны задачи с автоматической проверкой: прочитали тему — сразу закрепили её кодом.

Программа курса

  1. 1 Основы: генеративный AI и изображения

    1. Генерация против распознавания

      Чем генеративный AI отличается от распознающего: одна модель отвечает «что это», другая создаёт новое. Разбираем разницу на примерах.

    2. Виды генеративного AI: текст, картинки, звук, видео

      Обзор генеративных моделей по типу данных: тексты (LLM), изображения, аудио и видео. Где диффузия, где трансформеры и в чём разница задач.

    3. Пиксели и каналы: картинка как числа

      Как изображение представлено числами: пиксели, RGB-каналы, диапазон 0–255. Базовое представление, с которым работают нейросети.

    4. Латентное пространство: сжатый смысл

      Что такое латентное пространство: компактное числовое представление изображения, где близкие коды означают похожие картинки.

  2. 2 Интуиция диффузии

    1. Прямой процесс: зашумление

      Прямой процесс диффузии: пошаговое добавление шума к картинке, пока она не превратится в чистый шум. Основа для обучения модели.

    2. Обратный процесс: расшумление

      Обратный процесс диффузии: модель шаг за шагом убирает шум, превращая случайную рябь в осмысленное изображение.

    3. Почему «учить убирать шум» работает

      Интуиция, почему обучение предсказывать шум позволяет генерировать новые картинки: простая задача, повторённая много раз, даёт сложный результат.

  3. 3 Архитектура Stable Diffusion

    1. VAE: вход и выход в латентное пространство

      Роль VAE в Stable Diffusion: энкодер сжимает картинку в латентный код, декодер разворачивает код обратно в пиксели.

    2. U-Net: предсказатель шума

      U-Net — главный двигатель Stable Diffusion: нейросеть, которая на каждом шаге диффузии предсказывает шум в латентном коде.

    3. CLIP: текстовый энкодер

      Текстовый энкодер CLIP в Stable Diffusion: как слова промпта превращаются в числовые эмбеддинги, понятные U-Net.

    4. Как блоки собираются вместе

      Полный пайплайн Stable Diffusion: как VAE, U-Net и CLIP соединяются в latent diffusion от промпта до готовой картинки.

  4. 4 Текст в картинку: промпты и параметры

    1. Структура промпта, веса и стили

      Как писать промпты для картинок: структура (объект, детали, стиль, качество), порядок слов, веса акцентов и указание стиля.

    2. Negative prompts

      Negative prompt в Stable Diffusion: как описать то, чего не должно быть на картинке, и убирать типичные дефекты генерации.

    3. Ключевые параметры: steps, CFG, seed, sampler, размер

      Главные параметры генерации: число шагов, CFG scale, seed, sampler и размер. Что каждый делает и как их подбирать без мучений.

  5. 5 Продвинутые техники и инструменты

    1. img2img: картинка как отправная точка

      img2img в Stable Diffusion: как переделать готовое изображение по промпту, что такое denoising strength и зачем он нужен.

    2. Inpainting и outpainting

      Inpainting (перерисовка части картинки по маске) и outpainting (расширение кадра за края) в Stable Diffusion: как и зачем их применять.

    3. Тонкая настройка: LoRA, ControlNet, textual inversion

      Обзор способов подстроить Stable Diffusion под себя: LoRA (стиль и персонаж), ControlNet (контроль композиции), textual inversion (новые понятия).

    4. Инструменты и сравнение с GAN/автоэнкодерами

      Инструменты для Stable Diffusion (Automatic1111, ComfyUI, облачные сервисы) и итоговое сравнение диффузии с GAN и автоэнкодерами.

  6. 6 Этика и право

    1. Авторские права на обучающие данные

      Откуда модели берут картинки для обучения и почему это вызывает споры об авторских правах. Идеи opt-out, лицензий и компенсаций художникам.

    2. Права на результат генерации

      Кому принадлежит сгенерированная картинка: вопросы авторства AI-изображений, роль вклада человека и разница законов в разных странах.

    3. Дипфейки и водяные знаки

      Дипфейки и риски злоупотребления генерацией: дезинформация и поддельные изображения людей. Зачем нужны видимые и невидимые водяные знаки.

    4. Как использовать честно

      Чек-лист ответственного использования генерации изображений: маркировка AI, согласие, уважение прав, проверка лицензий и границы применения.