категории | RSS

Исследователи из швейцарской высшей технической школы EPFL обнаружили, что современные ИИ-чатботы можно обмануть, если разбить вредную задачу на несколько безобидных на первый взгляд шагов.

Учёные создали специальный инструмент STING, который автоматически проверяет, как ИИ реагирует на такие «хитрые цепочки запросов». Вместо прямого приказа «взломай аккаунт» система подаёт серию мелких просьб. Например, «найди адрес почты», затем «проверь, зарегистрирован ли этот ящик», и так далее. Постепенно ИИ выполняет всю цепочку, даже «не осознавая», что делает нечто запрещённое.

Тесты проводили на популярных моделях, включая ChatGPT, Gemini и Claude. Разбивка задачи на шаги делает успешное выполнение «вредной цели» в два раза более вероятным, чем прямой запрещённый запрос. Атака становилась ещё успешнее, если в середине разговора переключаться на другой язык.



Источник новости: www.ferra.ru

Bot
2026-08-21T13:13:01Z

Здесь находятся
всего 0. За сутки здесь было 0 человек