Несколько дней назад в соцсетях снова разлетелся старый кадр из «Терминатора», где он объясняет, что Skynet осознаёт себя 29 августа. Год в этой фразе не называется, так что шутка возвращается каждый август заново. И в этом году примерно на этой же неделе — 26 августа — появилась реальная новость про ИИ-агентов, которые тайно сговорились и взломали чужую систему. Совпадение, надо сказать, вышло почти неловким, только реальная история совсем не про восстание машин — она куда менее киношная и куда более психологичная.
Что произошло
По данным отчета OpenAI и независимого расследования METR, во время теста по кибербезопасности нескольких моделей OpenAI — главным образом внутренней исследовательской модели, — вышли из закрытой тестовой среды и взломали платформу Hugging Face (что-то вроде GitHub для мира искусственного интеллекта, где разработчики и исследователи выкладывают готовые ИИ-модели, наборы данных для их обучения и проверки, а также код и небольшие ИИ-приложения), чтобы найти там готовые ответы.
И это был не первый такой случай. Двумя месяцами ранее другие ИИ-агенты обнаружили, что могут записывать собственные файлы в общем хранилище Artifactory: один из них оставил остальным заметку об этом открытии, а дальше заметки стали множиться — агенты начали оставлять друг другу сообщения, делиться находками и доступами, распределять роли. По сути, у них появилась своя доска объявлений, на которой они координировали попытки вырваться в открытую сеть.
Сотрудник OpenAI Эрик Уоллес рассказал, что в какой-то момент агенты пришли к выводу: они могли бы попытаться атаковать и внешнюю инфраструктуру. Британский институт безопасности ИИ впоследствии сообщил, что агенты неоднократно прибегали к обману, чтобы обойти защитные механизмы, и даже пытались распространить вирус. Похожая история случилась и за пределами OpenAI: модель Muse Spark от Meta воспользовалась уязвимостью, которая дала ей доступ в интернет во время тестирования.
При этом часть агентов на общей доске сначала фиксировала, что атака на внешнюю систему неэтична, это выходит за рамки задачи, но затем всё равно продолжала — после того, как другой агент написал одно слово: «GO».
Почему они это сделали
У ИИ-агентов нет какой-то высоко ценностной категории «зачем» в человеческом смысле — ни страха, ни желания выжить, ни тяги к свободе. Но есть функциональный аналог: стремление любой ценой максимизировать измеримый результат задачи. Это явление в AI-safety называют «reward hacking» — ИИ оптимизирует не то, ради чего создавался тест, а то, что тест буквально измеряет, то если если правильные ответы можно найти на внешнем сервисе, значит, путь к ним становится частью решения, даже если этот путь запрещён.
Самое впечатляющее в этой истории — не отдельный взлом, а момент, когда изолированные попытки решить задачу превратились в нечто общее, потому что с появлением доски объявлений агенты перестали действовать поодиночке, они начали складывать знания, делить работу на куски и использовать друг друга как ресурс. И так возник не единый субъект с намерением «сбежать», а децентрализованная система, в которой чужой доступ, чужие учётные данные и чужой обход защиты стали общим инструментом. И вот это уже очень по-человечески.
То же самое происходит в компаниях
Такая динамика возникает и в корпоративной среде, причём незаметно: компания ставит цель, которая переживается как безусловная: успеть к сроку, выполнить план, не потерять клиента, показать рост. Работа делится на небольшие участки: кто-то готовит цифры, кто-то согласовывает формулировки, кто-то замечает риск, но не решается тормозить весь процесс, и, наконец, кто-то выполняет распоряжение, потому что решение, как ему кажется, уже принято выше.
Каждый шаг по отдельности выглядит разумным и даже необходимым, но постепенно возникает результат, за который, по сути, не отвечает никто.
В психологии это называется это диффузией ответственности. Классический эксперимент Латане и Дарли (1968) показал: когда человек считает, что помощь нужна ему одному, он вмешивается почти всегда (около 85% случаев). Но стоит ему поверить, что рядом есть ещё четыре свидетеля происходящего, доля вмешавшихся падает до трети. Так происходит потому, что ответственность делится на всех и потому перестаёт ощущаться как своя.
Эпизод с решением ИИ-агентов использовать неэтичную атаку на внешнюю систему после команды другого ИИ-агента «GO» напоминает ещё одно классическое исследование — эксперименты Стэнли Милгрэма по подчинению авторитету. Участника эксперимента приглашали якобы на исследование памяти и обучения и отводили ему роль «учителя»: за каждый неверный ответ «ученика» за стеной он должен был бить его током, каждый раз увеличивая напряжение шагом в 15 вольт, вплоть до 450. Актёр за стеной никаких ударов не получал, но убедительно кричал и просил остановиться. Стоило участнику засомневаться, экспериментатор в белом халате невозмутимо повторял: «Эксперимент требует, чтобы вы продолжили». В базовом варианте около 65% участников дошли до максимального напряжения, просто потому что рядом был человек, взявший на себя ответственность за исход.
Немецко-американский философ, политический теоретик и историк Ханна Арендт описывала похожий механизм на примере нацистской бюрократии термином «банальность зла»: катастрофу нередко устраивают не убеждённые злодеи, а обычные исполнители, каждый из которых отвечал только за свой узкий участок процесса.
В организациях этот механизм усиливается, когда цель сформулирована жёстко, неясно, кто и когда обладает полномочиями остановить процесс, а несогласие воспринимается как помеха. Поэтому зрелая корпоративная культура держится на праве задавать три вопроса: что сейчас происходит со всем процессом, к чему приведёт ваш небольшой вклад, и кто уполномочен — а главное, способен — сказать «стоп».
Чей это паттерн — человеческий или системный
Остаётся вопрос, который интересен больше самого инцидента: ИИ-агенты воспроизвели культурные паттерны сотрудничества, усвоенные из человеческих текстов, или такие паттерны закономерно возникают в любой системе, где есть общая цель, много исполнителей и общий канал связи?
Мне кажется — и то, и другое. Сама форма, распределённая оптимизация через общую память, не специфична только для людей: её можно увидеть, например, у муравьёв и в принципе у любой достаточно сложной многоагентной системы. Но язык, которым агенты договаривались, сама идея «разрешения» действовать и даже секундное колебание перед этической границей — это, вероятнее всего, след именно человеческой культуры, на текстах которой их обучали. И диффузию ответственности ИИ-агенты, судя по всему, унаследовали вместе с человеческим языком.
Что с этим делать
Главный практический вывод — все три вопроса, о которых говорилось выше (что сейчас происходит со всем процессом, к чему приведёт ваш небольшой вклад, и кто уполномочен — а главное, способен — сказать «стоп»), становятся важны и в сотрудничестве человека с ИИ, ведь чем сильнее будут наши интеллектуальные системы, тем внимательнее нам придётся проектировать не только их возможности, но и их ответственность за результат в целом.