Учебник Генеративный AI для начинающих
Этот курс объясняет, как нейросети создают изображения «из текста» — на примере Stable Diffusion и других диффузионных моделей. Вы пройдёте путь от интуиции (что такое генеративный AI и чем он отличается от распознавания) до практики: как устроен прямой и обратный процесс диффузии, из каких блоков собран Stable Diffusion (U-Net, VAE, текстовый энкодер CLIP), как писать промпты и подбирать параметры (steps, CFG scale, seed, sampler), что такое img2img, inpainting и ControlNet. Отдельный большой раздел — этика и право: авторские данные, дипфейки, водяные знаки и честное использование. Курс для тех, кто хочет понимать происходящее «под капотом», а не просто нажимать кнопки. Связан с нашими курсами «Как работает AI и ChatGPT», «Глубокое обучение» и «Компьютерное зрение».
Курс «Генеративный AI: Stable Diffusion» состоит из 6 разделов и 22 уроков: Основы: генеративный AI и изображения, Интуиция диффузии, Архитектура Stable Diffusion, Текст в картинку: промпты и параметры, Продвинутые техники и инструменты и Этика и право. Уроки идут по порядку — от основ к более сложным темам, в каждом есть объяснение с примерами, а в конце — вопросы для самопроверки. К урокам привязаны задачи с автоматической проверкой: прочитали тему — сразу закрепили её кодом.
Программа курса
1 Основы: генеративный AI и изображения
- Генерация против распознавания
Чем генеративный AI отличается от распознающего: одна модель отвечает «что это», другая создаёт новое. Разбираем разницу на примерах.
- Виды генеративного AI: текст, картинки, звук, видео
Обзор генеративных моделей по типу данных: тексты (LLM), изображения, аудио и видео. Где диффузия, где трансформеры и в чём разница задач.
- Пиксели и каналы: картинка как числа
Как изображение представлено числами: пиксели, RGB-каналы, диапазон 0–255. Базовое представление, с которым работают нейросети.
- Латентное пространство: сжатый смысл
Что такое латентное пространство: компактное числовое представление изображения, где близкие коды означают похожие картинки.
- Генерация против распознавания
2 Интуиция диффузии
- Прямой процесс: зашумление
Прямой процесс диффузии: пошаговое добавление шума к картинке, пока она не превратится в чистый шум. Основа для обучения модели.
- Обратный процесс: расшумление
Обратный процесс диффузии: модель шаг за шагом убирает шум, превращая случайную рябь в осмысленное изображение.
- Почему «учить убирать шум» работает
Интуиция, почему обучение предсказывать шум позволяет генерировать новые картинки: простая задача, повторённая много раз, даёт сложный результат.
- Прямой процесс: зашумление
3 Архитектура Stable Diffusion
- VAE: вход и выход в латентное пространство
Роль VAE в Stable Diffusion: энкодер сжимает картинку в латентный код, декодер разворачивает код обратно в пиксели.
- U-Net: предсказатель шума
U-Net — главный двигатель Stable Diffusion: нейросеть, которая на каждом шаге диффузии предсказывает шум в латентном коде.
- CLIP: текстовый энкодер
Текстовый энкодер CLIP в Stable Diffusion: как слова промпта превращаются в числовые эмбеддинги, понятные U-Net.
- Как блоки собираются вместе
Полный пайплайн Stable Diffusion: как VAE, U-Net и CLIP соединяются в latent diffusion от промпта до готовой картинки.
- VAE: вход и выход в латентное пространство
4 Текст в картинку: промпты и параметры
- Структура промпта, веса и стили
Как писать промпты для картинок: структура (объект, детали, стиль, качество), порядок слов, веса акцентов и указание стиля.
- Negative prompts
Negative prompt в Stable Diffusion: как описать то, чего не должно быть на картинке, и убирать типичные дефекты генерации.
- Ключевые параметры: steps, CFG, seed, sampler, размер
Главные параметры генерации: число шагов, CFG scale, seed, sampler и размер. Что каждый делает и как их подбирать без мучений.
- Структура промпта, веса и стили
5 Продвинутые техники и инструменты
- img2img: картинка как отправная точка
img2img в Stable Diffusion: как переделать готовое изображение по промпту, что такое denoising strength и зачем он нужен.
- Inpainting и outpainting
Inpainting (перерисовка части картинки по маске) и outpainting (расширение кадра за края) в Stable Diffusion: как и зачем их применять.
- Тонкая настройка: LoRA, ControlNet, textual inversion
Обзор способов подстроить Stable Diffusion под себя: LoRA (стиль и персонаж), ControlNet (контроль композиции), textual inversion (новые понятия).
- Инструменты и сравнение с GAN/автоэнкодерами
Инструменты для Stable Diffusion (Automatic1111, ComfyUI, облачные сервисы) и итоговое сравнение диффузии с GAN и автоэнкодерами.
- img2img: картинка как отправная точка
6 Этика и право
- Авторские права на обучающие данные
Откуда модели берут картинки для обучения и почему это вызывает споры об авторских правах. Идеи opt-out, лицензий и компенсаций художникам.
- Права на результат генерации
Кому принадлежит сгенерированная картинка: вопросы авторства AI-изображений, роль вклада человека и разница законов в разных странах.
- Дипфейки и водяные знаки
Дипфейки и риски злоупотребления генерацией: дезинформация и поддельные изображения людей. Зачем нужны видимые и невидимые водяные знаки.
- Как использовать честно
Чек-лист ответственного использования генерации изображений: маркировка AI, согласие, уважение прав, проверка лицензий и границы применения.
- Авторские права на обучающие данные