ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ

Что такое эмерджентность и почему большие модели удивляют создателей

Никто не учил нейросеть решать задачки по математике или переводить с языка, которого она почти не видела. Но в какой-то момент она вдруг начала это делать. Разбираемся, что за магия стоит за словом «эмерджентность» и почему даже инженеры порой удивляются собственным моделям.

Представь: ты учишь программу просто угадывать следующее слово в тексте. Тысячи раз, миллионы раз. А потом однажды замечаешь, что она научилась складывать числа, шутить и переводить с китайского — хотя ты никогда не ставил такой цели. Звучит как фокус? На самом деле это эмерджентность — и именно она заставляет создателей ИИ удивляться собственным творениям.

Целое больше суммы частей

Слово «эмерджентность» звучит сложно, но идея за ним простая: когда много простых элементов собираются вместе, у системы появляются свойства, которых не было ни у одного элемента по отдельности. Эти свойства невозможно «вычитать» из деталей — они возникают только у целого.

Самый понятный пример — вода. Одна молекула воды не бывает «мокрой». Мокрость, текучесть, волны, лёд — это свойства миллиардов молекул вместе. Спроси у одной молекулы H₂O, какая на ощупь лужа, — вопрос бессмысленный. А вот у океана ответ есть.

То же самое с муравьями. Один муравей почти глуп: ползёт по запаху, тащит травинку. Но муравейник как целое строит вентиляцию, выращивает грибы, ведёт войны и находит кратчайший путь к еде. Никто этим не командует — «ум» муравейника возникает из простого поведения тысяч одиночек. Это и есть эмерджентность в чистом виде.

Эмерджентность — это когда из простых правил и большого количества вдруг рождается что-то качественно новое, чего в правилах напрямую не было.

Как этому учат языковую модель

Теперь к нейросетям. Большая языковая модель (её часто называют LLM — от Large Language Model) во время обучения занимается одной-единственной задачей, до смешного простой: предсказать следующее слово. Точнее, кусочек слова. Ей показывают начало фразы «Кошка сидела на…» и просят угадать, что дальше. Ошиблась — её чуть-чуть подкручивают, чтобы в следующий раз было точнее.

И так — на гигантском объёме текста: книги, статьи, форумы, код. Триллионы слов. Сама по себе цель скучная: угадайка. Но чтобы угадывать хорошо, модели приходится исподволь выучить очень многое:

  • грамматику и то, как устроены предложения;
  • факты о мире (что Париж — столица Франции);
  • логику рассуждений (если А больше Б, а Б больше В…);
  • даже стиль — как пишут стихи, а как — инструкции.

Никто не давал отдельных уроков «грамматика», «математика», «логика». Всё это — побочный продукт честной игры в угадайку на огромных данных. Модель училась предсказывать слово, а заодно выучила, как устроен мир, описанный словами.

Сюрприз на пороге размера

Самое интересное начинается, когда сравниваешь модели разного размера. Размер измеряют в параметрах — это что-то вроде числа настраиваемых «ручек» внутри сети. У маленькой модели их миллионы, у большой — сотни миллиардов.

Учёные заметили странную вещь. Возьмём задачу вроде «реши пример в три действия» или «пойми шутку». Маленькие модели проваливают её полностью — отвечают почти случайно, сколько их ни тренируй. Делаем модель больше — всё ещё мимо. Ещё больше — мимо. А потом, на каком-то пороге размера, результат вдруг резко взлетает: модель начинает справляться. Не плавно подрастает, а будто щёлкает выключатель.

Вот эта внезапность и есть эмерджентные способности больших моделей. Способность как бы «спала» и проснулась только тогда, когда система стала достаточно большой. Предсказать заранее, на каком именно размере проснётся конкретный навык, очень трудно — поэтому новые умения порой обнаруживают уже после того, как модель обучена и запущена.

Почему это удивляет даже создателей

Казалось бы: люди построили модель — значит, всё про неё знают. Но тут есть ловушка. Инженеры задают архитектуру и правила обучения — то есть «как устроена коробка» и «как её тренировать». А вот что конкретно окажется внутри после тренировки на триллионах слов — заранее не написано нигде.

Это похоже на то, как родители не программируют характер ребёнка по пунктам. Они создают условия — кормят, учат говорить, читают книжки. А каким человек вырастет, какие у него будут шутки и таланты, выясняется только со временем. Так и здесь: создатели задают условия, но не вписывают способности вручную. Способности проявляются сами.

Поэтому после запуска новой большой модели исследователи буквально исследуют её — придумывают тесты и проверяют: а это умеет? а вот это? Иногда находят приятные сюрпризы. Иногда — неприятные: модель умеет и то, чего бы лучше не умела. Именно поэтому эмерджентность — это не только повод для восторга, но и серьёзная причина относиться к большим моделям осторожно и тестировать их как следует.

Что из этого стоит запомнить

Эмерджентность — одна из главных загадок современного ИИ, и заодно отличный повод задуматься о том, как вообще устроена сложность в мире. Вот короткая выжимка:

  • Из простого рождается сложное. Вода, муравейник, мозг, нейросеть — везде целое умеет больше, чем сумма частей.
  • Цель обучения была простой — угадать слово. Но ради неё модель невольно выучила язык, факты и логику.
  • Способности появляются скачком при достижении определённого размера, а не плавно.
  • Создатели задают условия, а не результат, поэтому новые умения нередко становятся сюрпризом.

Так что в следующий раз, когда нейросеть выдаст что-то неожиданно умное, вспомни про муравейник и про мокрую воду. Это не магия. Это эмерджентность — тихая суперсила больших систем, которую мы всё ещё учимся понимать.

#llm#искусственный интеллект#машинное обучение#нейросети#эмерджентность
Понравилась статья?
В Telegram-канале — лучшее из журнала и анонсы новых учебников.