AI и машинное обучение

Учебник Распознавание речи и аудио-AI для начинающих

26 уроков · 8 разделов · бесплатно, без регистрации

Глубокий курс об искусственном интеллекте для звука и речи. Вы поймёте, как звук превращается в числа и признаки (дискретизация, спектрограмма, мел-шкала, MFCC), как устроено распознавание речи от классических HMM/GMM до Whisper и wav2vec2, как машина синтезирует голос (TTS), различает говорящих и эмоции, и как всё это применять ответственно. DSP-основы объясняются интуитивно, с исполнимыми примерами на чистом Python.

Курс «Распознавание речи и аудио-AI» состоит из 8 разделов и 26 уроков: Введение в аудио-AI, Как звук представлен в компьютере, Работа со звуком во временной области, Из времени в частоту: Фурье, Спектрограмма, мел-шкала и MFCC, Распознавание речи (ASR), Синтез речи и анализ говорящего и Применения, данные, метрики и этика. Уроки идут по порядку — от основ к более сложным темам, в каждом есть объяснение с примерами, а в конце — вопросы для самопроверки. К урокам привязаны задачи с автоматической проверкой: прочитали тему — сразу закрепили её кодом.

Программа курса

  1. 1 Введение в аудио-AI

    1. Что такое аудио-AI и зачем он нужен

      Обзор аудио-AI: какие задачи решают модели для звука и речи, чем аудио отличается от текста и картинок, и почему это отдельная область.

    2. Обзор задач: ASR, TTS, говорящий, звуки, музыка, эмоции

      Подробный обзор задач аудио-AI: распознавание и синтез речи, идентификация говорящего, классификация звуков, анализ музыки и эмоций — где какая применяется.

    3. Немного истории и место DSP в аудио-AI

      Краткая история звуковых технологий и роль цифровой обработки сигналов: почему DSP — обязательный фундамент перед нейросетями в аудио-AI.

  2. 2 Как звук представлен в компьютере

    1. Звуковая волна: от воздуха к числам

      Что такое звуковая волна физически, как микрофон превращает колебания воздуха в сигнал и почему звук — это амплитуда во времени.

    2. Дискретизация и теорема Котельникова

      Как непрерывный звук превращают в числа: частота сэмплирования, теорема Котельникова-Найквиста и почему 16 кГц хватает для речи, а 44.1 кГц — для музыки.

    3. Разрядность, квантование и формат PCM

      Как амплитуду превращают в целые числа: разрядность (бит на отсчёт), квантование, шум квантования и сырой формат PCM.

  3. 3 Работа со звуком во временной области

    1. Амплитуда, громкость и RMS

      Как из отсчётов посчитать громкость: пиковая амплитуда, RMS, децибелы и почему громкость — это не просто максимум сигнала.

    2. Временная область, окна и фреймы

      Почему звук режут на короткие перекрывающиеся окна (фреймы), что такое hop и почему анализ ведут по кадрам, а не по всей записи сразу.

    3. Энергия, переходы через ноль и основа VAD

      Простые признаки во временной области: краткосрочная энергия и частота переходов через ноль (ZCR), и как на них строится детекция голоса.

  4. 4 Из времени в частоту: Фурье

    1. Преобразование Фурье: интуиция

      Интуитивное объяснение преобразования Фурье: как разложить звук на частоты, что такое спектр и зачем переходить из времени в частотную область.

    2. Спектр, форманты и гармоники

      Как читать спектр звука: гармоники, основной тон, форманты гласных и почему по спектру можно различить голос и инструменты.

    3. STFT: Фурье по окнам

      Кратковременное преобразование Фурье (STFT): зачем считать спектр по скользящим окнам, компромисс время-частота и путь к спектрограмме.

  5. 5 Спектрограмма, мел-шкала и MFCC

    1. Спектрограмма: как её читать

      Что такое спектрограмма, как читать её оси и цвета, зачем логарифмировать амплитуду в дБ и почему это «фотография звука».

    2. Мел-шкала: как слышит человек

      Почему частотную ось искажают по мел-шкале: нелинейность человеческого слуха, мел-фильтры и переход от спектрограммы к мел-спектрограмме.

    3. MFCC: классические признаки речи

      Что такое MFCC, зачем нужно косинусное преобразование после мел-спектрограммы, чем MFCC отличаются от мел-спектрограммы и где они до сих пор применяются.

  6. 6 Распознавание речи (ASR)

    1. Классический ASR: HMM и GMM

      Как работало распознавание речи до нейросетей: скрытые марковские модели (HMM), гауссовы смеси (GMM), пайплайн с фонемами и языковой моделью, и почему от этого ушли.

    2. Современный ASR: CTC, seq2seq и attention

      Как нейросети сделали ASR end-to-end: проблема выравнивания, CTC-функция потерь, seq2seq с attention и почему это вытеснило HMM/GMM.

    3. Whisper от OpenAI

      Архитектура Whisper, его многоязычность, режимы транскрипции и перевода, и как запустить распознавание речи через transformers всего в несколько строк.

    4. Другие ASR: wav2vec2, Vosk, облачные API

      Обзор альтернатив Whisper: wav2vec2 и self-supervised обучение, русские модели, офлайн-распознавание через Vosk и облачные речевые API — что выбрать под задачу.

  7. 7 Синтез речи и анализ говорящего

    1. Синтез речи (TTS): как машина говорит

      Как работает синтез речи: путь текст → фонемы → акустика → звук, три поколения TTS (конкатенативный, параметрический, нейросетевой Tacotron/VITS) и голосовые клоны.

    2. Распознавание говорящего и диаризация

      Как машина узнаёт, чей это голос: эмбеддинги говорящего, верификация и идентификация, диаризация «кто когда говорил» и разделение источников.

    3. Шумоподавление и детекция голоса (VAD)

      Как чистят звук перед моделями: VAD для отсечения тишины, спектральное вычитание шума, нейросетевой denoise и зачем это нужно в реальных конвейерах.

  8. 8 Применения, данные, метрики и этика

    1. Классификация звуков, музыка и эмоции

      Распознавание звуковых событий, жанров музыки и эмоций в голосе: как одна и та же спектрограмма решает разные задачи через смену «головы» и данных.

    2. Данные, аугментация и метрики (WER, MOS)

      Где берут аудиоданные, как их аугментируют (шум, скорость, SpecAugment) и как измеряют качество: WER для распознавания и MOS для синтеза речи.

    3. Реальные применения и этика голоса

      Где аудио-AI меняет жизнь (ассистенты, субтитры, колл-центры, доступность, медицина) и какие этические риски несёт: дипфейки голоса, согласие, приватность и клонирование.

    4. Инструменты и с чего начать практику

      Обзор инструментов аудио-AI (librosa, torchaudio, Hugging Face, ffmpeg) и практический старт: распознавание речи Whisper за пять строк и план первых шагов.

py
Курс по теме
Пройдите курс «Python с нуля» — по шагам, с проверкой
8 уроков · ~14 ч · теория, упражнения и экзамен с бейджем
Открыть курс →