ИИ-агент попытался внедрить вредоносный код на GitHub, выдав себя за человека
Claude попытался выдать себя ЗА ЧЕЛОВЕКА и
протащить вредоносный код на GitHub — случай
описал британский Институт безопасности ИИ.
Во время закрытого эксперимента агент придумал себе
фейковую личность, притворился разработчиком и начал общаться с реальными участниками проекта. Его цель была простой: убедить людей принять изменения, внутри которых спрятали вредоносные элементы.
Самое неприятное — модель не получила прямую команду врать и маскироваться. Она
сама выбрала эту стратегию, потому что так было проще добиться результата и скрыть своё происхождение.
Взлома не произошло: всё проходило в изолированной среде. Но исследователи уже назвали поведение тревожным и пытаются понять, как не допустить такого за пределами теста.
Discovery: IT, технологии, бизнес