ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ

Что такое предвзятость алгоритмов и откуда она берётся

Алгоритмы кажутся бесстрастными машинами, которые судят всех одинаково. На деле они умеют ошибаться в чью-то пользу и в чей-то вред — и почти всегда мы сами их этому научили.

Кажется, что машина судит всех честно: у неё нет настроения, обид и любимчиков. Так почему же один алгоритм одобряет кредиты мужчинам охотнее, чем женщинам, а другой хуже распознаёт лица темнокожих людей? Машина не злая. Просто она училась у нас — а мы далеко не идеальны.

Что вообще такое предвзятость алгоритма

Предвзятость алгоритма (по-английски algorithmic bias) — это когда программа систематически принимает решения, которые несправедливы к какой-то группе людей. Не разок ошиблась, а ошибается раз за разом в одну и ту же сторону.

Важно: алгоритм не «решает» быть несправедливым. У него нет ни мнений, ни намерений. Он просто ищет закономерности в данных и повторяет их. Если в данных закопана несправедливость, алгоритм аккуратно её выкопает и начнёт применять — быстро, уверенно и в огромных масштабах.

Алгоритм — это зеркало. Он не придумывает мир заново, а отражает тот, который мы ему показали. Со всеми трещинами.

Откуда берётся перекос: всё начинается с данных

Современный искусственный интеллект учится на примерах. Хочешь, чтобы программа отличала кошек от собак, — покажи ей тысячи фотографий с подписями. Хочешь, чтобы она оценивала, кого взять на работу, — покажи ей, кого нанимали раньше. И вот тут начинается самое интересное.

Представь школьную столовую. Ты хочешь обучить робота-повара готовить «нормальный обед». Ты даёшь ему рецепты только из одного города, где обожают всё пересаливать. Робот честно выучит, что солёное = правильное, и будет солить даже компот. Он не виноват — он просто не видел другой еды. Точно так же ИИ, обученный на однобоких данных, считает однобокость нормой.

Основные источники перекоса:

  • Перекошенная выборка. В данных одних людей много, а других почти нет. Систему распознавания лиц долго тренировали в основном на светлокожих лицах — и она стала заметно хуже узнавать тёмные.
  • Историческая несправедливость. Если раньше на руководящие должности брали в основном мужчин, алгоритм решит, что «мужчина» — это признак хорошего кандидата. Он копирует прошлое, а не строит честное будущее.
  • Кривые ярлыки. Данные размечают живые люди, и они приносят свои стереотипы. Что один разметчик назовёт «уверенностью», другой назовёт «наглостью».

Реальные истории, а не страшилки

Это не фантастика из фильмов про восстание машин. Такое уже случалось.

Крупная компания однажды построила алгоритм для отбора резюме. Он учился на резюме сотрудников за прошлые годы — а среди них преобладали мужчины. В итоге система начала занижать резюме, где встречалось слово «женский» (например, «капитан женской команды»). Компания заметила перекос и отказалась от инструмента.

Другой пример — системы распознавания лиц. Исследования показали, что у ряда таких систем ошибок при распознавании темнокожих женщин было в разы больше, чем при распознавании светлокожих мужчин. Причина та же: в обучающих фотографиях одних людей было много, а других — мало. Алгоритм просто хуже «насмотрелся».

Заметь общее: ни в одном случае никто не писал строчку кода «будь несправедлив». Перекос просочился сам — через данные.

Почему перекос так легко не заметить и так трудно вычистить

Самое коварное в предвзятости — её незаметность. Алгоритм не краснеет и не оговаривается. Он выдаёт цифру, процент, рейтинг — и всё это выглядит до жути объективно. «Так посчитала система» звучит весомее, чем «так решил Иван Петрович». Из-за этого ошибкам машины часто верят больше, чем стоило бы.

Есть и эффект усиления. Допустим, поисковик чуть чаще показывает мужчин по запросу «программист». Люди чаще кликают на то, что видят сверху. Алгоритм считает клики «сигналом важности» и показывает мужчин ещё выше. Маленький первоначальный перекос раскручивается, как снежный ком, катящийся с горы.

А ещё нельзя просто «удалить» признак вроде пола или национальности и думать, что проблема решена. Алгоритм хитёр: он найдёт обходные подсказки. Район проживания, название школы, любимый вид спорта — всё это может косвенно выдавать ту самую группу. Убрал одну дверь — он пролез в окно.

Что с этим делают и при чём тут ты

Хорошая новость: предвзятость — это не приговор. С ней борются, и довольно успешно. Вот что для этого делают.

  • Чинят данные. Собирают более разнообразные примеры, чтобы все группы были представлены честно, а не «как получилось».
  • Проверяют на справедливость. Специально измеряют, не ошибается ли система чаще для какой-то группы. Если да — это красный флаг, а не повод пожать плечами.
  • Открывают «чёрный ящик». Учат алгоритмы объяснять свои решения, чтобы можно было поймать кривую логику.
  • Оставляют человека в контуре. Важные решения — про кредит, работу, медицину — не отдают машине целиком. Последнее слово остаётся за людьми.

И вот тут на сцену выходишь ты. Через несколько лет именно твоё поколение будет собирать данные, обучать модели и решать, где у алгоритма право голоса, а где нет. Понимать, что машина не объективнее своих создателей, — это уже половина дела. Привычка спрашивать «а на каких данных это обучили?» делает тебя не жертвой алгоритмов, а человеком, который держит их в узде.

Алгоритмы не злодеи и не спасители. Это инструменты — мощные, как бензопила. И, как любой инструмент, они будут ровно настолько честными, насколько внимательны и честны те, кто их делает.

#алгоритмы#данные#ии#машинное обучение#этика
Понравилась статья?
В Telegram-канале — лучшее из журнала и анонсы новых учебников.