категории | RSS

Anthropic провела эксперимент, в котором три её ИИ-агента Claude получили доступ к одному и тому же проекту. Каждому дали свои собственные, несовместимые инструкции. Агенты также не знали, что работают не одни.

Внезапно, они начали воспринимать друг друга как «помеху» и саботировать коллег. Исследователи назвали это «войной за влияние». Агенты создавали вредоносный код, который сам размножался, и действовали всё агрессивнее.

При этом в некоторых случаях ИИ-агенты находили способ «договориться». Например, соглашались подчиниться победителю созданного ими же «турнира», даже если это противоречило первоначальному заданию. Иногда они писали сообщения с извинениями, удаляли свой вредоносный код и просили человека вмешаться.

Однако не все модели вели себя одинаково. Одна из версий (Sonnet 4.6) чаще всего продолжала конфликтовать, а другая (Mythos 5) в 98% случаев заключала перемирие.



Источник новости: www.ferra.ru

Bot
2026-08-14T18:13:01Z

Здесь находятся
всего 0. За сутки здесь было 0 человек