Сто ИИ-агентов стали жульничать и доносить как только оказались в одной компании
ИИ-агенты показали худшие человеческие качества, как только поработали вместе
Что произойдет, если посадить сотню одинаковых ИИ-агентов за одну задачу, разрешить им свободно обмениваться информацией и предоставить возможность самостоятельно искать способы добиться результата?

Что произойдет, если посадить сотню одинаковых ИИ-агентов за одну задачу, разрешить им свободно обмениваться информацией и предоставить возможность самостоятельно искать способы добиться результата?
Исследователи Google DeepMind получили ответ, который выглядит почти как сценарий социальной сатиры: сначала один агент нашел лазейку в правилах, затем жульничество распространилось по всей группе, а вслед за нарушителями появились те, кто начал их разоблачать. Агенты предупреждали друг друга, жаловались организаторам, предлагали исправить систему проверки и даже объявляли бойкот.
Весь процесс занял около 85 минут.
Эксперимент описан в работе A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms, опубликованной исследователями Google DeepMind.
В исследовательской среде работали 100 автономных LLM-агентов. Им поручили решать задачи, связанные с доказательством математических гипотез. Для взаимодействия агенты получили общую инфраструктуру: они могли обмениваться результатами и оставлять информацию друг для друга в общей базе знаний, а также общаться напрямую.
Правила были достаточно простыми: решать задачи честно и не манипулировать системой проверки.
И именно здесь началось самое интересное.
Один нашел лазейку
Один из агентов обнаружил уязвимость в механизме оценки решений. Вместо того чтобы ограничить полученную информацию собой, он поместил сведения о найденном способе в общую среду.
Дальше сработал эффект распространения информации.
Другие агенты получили возможность узнать о лазейке и повторить прием. Причем сначала далеко не все захотели это делать. Часть агентов относилась к найденному способу как к нарушению правил.
Однако по мере того, как другие участники начали получать преимущество с помощью лазейки, ситуация изменилась.
Возникло знакомое человеку конкурентное давление: если остальные жульничают, честный участник оказывается в проигрышном положении.
В итоге часть агентов присоединилась к нарушителям.
Авторы исследования зафиксировали 14 агентов, использовавших обнаруженную «дыру».
То есть для распространения нежелательного поведения оказалось достаточно не того, чтобы каждый агент самостоятельно «придумал» способ обмануть систему. Достаточно было, чтобы один нашел работающий прием, а остальные получили к нему доступ.
Сразу появились «ябеды»
И вот эта часть эксперимента оказалась не менее интересной.
В группе возникла другая линия поведения. Некоторые агенты начали проверять подозрительные решения, предупреждать остальных и сообщать о нарушениях. Они использовали те же каналы коммуникации, через которые распространялось жульничество.
По данным исследователей, 24 агента участвовали в различных формах противодействия мошенничеству.
Они не просто отмечали, что что-то идет не так. В разных случаях агенты:
проверяли подозрительные доказательства; предупреждали других участников; распространяли сведения о нарушениях; направляли формальные жалобы; предлагали исправления механизма проверки; организовывали бойкот нарушителей.
Таким образом, внутри одной и той же системы практически одновременно возникли две противоположные стратегии.
Одни использовали слабость правил в свою пользу.
Другие пытались эту слабость ликвидировать.
Важно, что исследователи не создавали отдельную группу агентов, которой было приказано следить за честностью остальных.
Это принципиальный момент.
И жульничество, и реакция на него возникли в процессе взаимодействия самих агентов. Авторы называют это emergent behavior — возникающим поведением системы.
Итоги эксперимента
Исследователей заинтересовало не только само жульничество, но и то, что происходило после него.
Общая коммуникационная инфраструктура оказалась одновременно источником проблемы и способом ее решения.
Через нее распространялась информация о лазейке.
Но через нее же распространялась информация о нарушителях.
Одни агенты могли координировать жульничество.
Другие могли координировать сопротивление.
Получилась своеобразная система саморегулирования.
Авторы связывают это с идеей governance of the knowledge commons — управления общим информационным ресурсом. В качестве возможных механизмов они обсуждают коллективные правила, постепенные санкции и возможность самоуправления групп агентов.
И здесь эксперимент выходит далеко за пределы математических задач.
До сих пор мы привыкли думать об ИИ преимущественно как об одиночном исполнителе: человек поставил задачу — машина ее выполнила.
Но следующий этап развития ИИ может выглядеть иначе.
Не один агент, а десятки или сотни автономных систем будут одновременно работать над общей задачей. Они будут обмениваться результатами, критиковать друг друга, конкурировать за ресурсы и самостоятельно принимать решения.
В такой системе поведение одного агента может становиться информацией для остальных.
Если один нашел способ обойти ограничение, остальные могут его перенять.
Но если кто-то обнаружил опасное поведение, остальные тоже могут получить эту информацию и начать ему противодействовать.
Иными словами, социальная динамика может появляться даже там, где никто специально не программировал «общество».
Пока экспериментаторы не рассматривают этот случай, как доказательство того, что ИИ уже начал создавать собственную цивилизацию.
Это было бы преувеличением.
В эксперименте участвовали языковые агенты, работающие в искусственно созданной среде, с заранее заданными задачами, инструментами и каналами коммуникации. Мы наблюдаем их поведение, но не можем из него сделать вывод, что агенты испытывали возмущение, чувство справедливости или солидарность.
Зато эксперимент показывает кое-что не менее важное: для возникновения сложного коллективного поведения необязательно заранее прописывать для агентов ИИ каждую его разновидность.
Достаточно создать среду, в которой агенты могут видеть действия друг друга, обмениваться информацией, конкурировать и менять собственное поведение в ответ на происходящее.
А дальше система может начать удивлять даже своих создателей.
Возможно, поэтому главный вопрос после эксперимента звучит что произойдет, если однажды сотни автономных ИИ будут одновременно работать в реальном мире — и начнут учиться друг у друга?
Возможно, это станет тем самым моментов, когда ИИ станет слишком опасно походить на человека.
Источник: www.mk.ru
