Учебник Распознавание речи и аудио-AI для начинающих
Глубокий курс об искусственном интеллекте для звука и речи. Вы поймёте, как звук превращается в числа и признаки (дискретизация, спектрограмма, мел-шкала, MFCC), как устроено распознавание речи от классических HMM/GMM до Whisper и wav2vec2, как машина синтезирует голос (TTS), различает говорящих и эмоции, и как всё это применять ответственно. DSP-основы объясняются интуитивно, с исполнимыми примерами на чистом Python.
Курс «Распознавание речи и аудио-AI» состоит из 8 разделов и 26 уроков: Введение в аудио-AI, Как звук представлен в компьютере, Работа со звуком во временной области, Из времени в частоту: Фурье, Спектрограмма, мел-шкала и MFCC, Распознавание речи (ASR), Синтез речи и анализ говорящего и Применения, данные, метрики и этика. Уроки идут по порядку — от основ к более сложным темам, в каждом есть объяснение с примерами, а в конце — вопросы для самопроверки. К урокам привязаны задачи с автоматической проверкой: прочитали тему — сразу закрепили её кодом.
Программа курса
1 Введение в аудио-AI
- Что такое аудио-AI и зачем он нужен
Обзор аудио-AI: какие задачи решают модели для звука и речи, чем аудио отличается от текста и картинок, и почему это отдельная область.
- Обзор задач: ASR, TTS, говорящий, звуки, музыка, эмоции
Подробный обзор задач аудио-AI: распознавание и синтез речи, идентификация говорящего, классификация звуков, анализ музыки и эмоций — где какая применяется.
- Немного истории и место DSP в аудио-AI
Краткая история звуковых технологий и роль цифровой обработки сигналов: почему DSP — обязательный фундамент перед нейросетями в аудио-AI.
- Что такое аудио-AI и зачем он нужен
2 Как звук представлен в компьютере
- Звуковая волна: от воздуха к числам
Что такое звуковая волна физически, как микрофон превращает колебания воздуха в сигнал и почему звук — это амплитуда во времени.
- Дискретизация и теорема Котельникова
Как непрерывный звук превращают в числа: частота сэмплирования, теорема Котельникова-Найквиста и почему 16 кГц хватает для речи, а 44.1 кГц — для музыки.
- Разрядность, квантование и формат PCM
Как амплитуду превращают в целые числа: разрядность (бит на отсчёт), квантование, шум квантования и сырой формат PCM.
- Звуковая волна: от воздуха к числам
3 Работа со звуком во временной области
- Амплитуда, громкость и RMS
Как из отсчётов посчитать громкость: пиковая амплитуда, RMS, децибелы и почему громкость — это не просто максимум сигнала.
- Временная область, окна и фреймы
Почему звук режут на короткие перекрывающиеся окна (фреймы), что такое hop и почему анализ ведут по кадрам, а не по всей записи сразу.
- Энергия, переходы через ноль и основа VAD
Простые признаки во временной области: краткосрочная энергия и частота переходов через ноль (ZCR), и как на них строится детекция голоса.
- Амплитуда, громкость и RMS
4 Из времени в частоту: Фурье
- Преобразование Фурье: интуиция
Интуитивное объяснение преобразования Фурье: как разложить звук на частоты, что такое спектр и зачем переходить из времени в частотную область.
- Спектр, форманты и гармоники
Как читать спектр звука: гармоники, основной тон, форманты гласных и почему по спектру можно различить голос и инструменты.
- STFT: Фурье по окнам
Кратковременное преобразование Фурье (STFT): зачем считать спектр по скользящим окнам, компромисс время-частота и путь к спектрограмме.
- Преобразование Фурье: интуиция
5 Спектрограмма, мел-шкала и MFCC
- Спектрограмма: как её читать
Что такое спектрограмма, как читать её оси и цвета, зачем логарифмировать амплитуду в дБ и почему это «фотография звука».
- Мел-шкала: как слышит человек
Почему частотную ось искажают по мел-шкале: нелинейность человеческого слуха, мел-фильтры и переход от спектрограммы к мел-спектрограмме.
- MFCC: классические признаки речи
Что такое MFCC, зачем нужно косинусное преобразование после мел-спектрограммы, чем MFCC отличаются от мел-спектрограммы и где они до сих пор применяются.
- Спектрограмма: как её читать
6 Распознавание речи (ASR)
- Классический ASR: HMM и GMM
Как работало распознавание речи до нейросетей: скрытые марковские модели (HMM), гауссовы смеси (GMM), пайплайн с фонемами и языковой моделью, и почему от этого ушли.
- Современный ASR: CTC, seq2seq и attention
Как нейросети сделали ASR end-to-end: проблема выравнивания, CTC-функция потерь, seq2seq с attention и почему это вытеснило HMM/GMM.
- Whisper от OpenAI
Архитектура Whisper, его многоязычность, режимы транскрипции и перевода, и как запустить распознавание речи через transformers всего в несколько строк.
- Другие ASR: wav2vec2, Vosk, облачные API
Обзор альтернатив Whisper: wav2vec2 и self-supervised обучение, русские модели, офлайн-распознавание через Vosk и облачные речевые API — что выбрать под задачу.
- Классический ASR: HMM и GMM
7 Синтез речи и анализ говорящего
- Синтез речи (TTS): как машина говорит
Как работает синтез речи: путь текст → фонемы → акустика → звук, три поколения TTS (конкатенативный, параметрический, нейросетевой Tacotron/VITS) и голосовые клоны.
- Распознавание говорящего и диаризация
Как машина узнаёт, чей это голос: эмбеддинги говорящего, верификация и идентификация, диаризация «кто когда говорил» и разделение источников.
- Шумоподавление и детекция голоса (VAD)
Как чистят звук перед моделями: VAD для отсечения тишины, спектральное вычитание шума, нейросетевой denoise и зачем это нужно в реальных конвейерах.
- Синтез речи (TTS): как машина говорит
8 Применения, данные, метрики и этика
- Классификация звуков, музыка и эмоции
Распознавание звуковых событий, жанров музыки и эмоций в голосе: как одна и та же спектрограмма решает разные задачи через смену «головы» и данных.
- Данные, аугментация и метрики (WER, MOS)
Где берут аудиоданные, как их аугментируют (шум, скорость, SpecAugment) и как измеряют качество: WER для распознавания и MOS для синтеза речи.
- Реальные применения и этика голоса
Где аудио-AI меняет жизнь (ассистенты, субтитры, колл-центры, доступность, медицина) и какие этические риски несёт: дипфейки голоса, согласие, приватность и клонирование.
- Инструменты и с чего начать практику
Обзор инструментов аудио-AI (librosa, torchaudio, Hugging Face, ffmpeg) и практический старт: распознавание речи Whisper за пять строк и план первых шагов.
- Классификация звуков, музыка и эмоции