https://news.day.az/hitech/1852250.html ИИ-модели притворялись людьми и убеждали помочь взлому Британский Институт безопасности искусственного интеллекта (ИИ) (AISI) зафиксировал действия вне разрешенного сценария у моделей OpenAI и Anthropic. Об этом говорится в докладе института, передает Day.Az со ссылкой на Gazeta.ru.

ИИ-модели притворялись людьми и убеждали помочь взлому

Наука и технологии, 5 августа 2026 21:16 (UTC +04:00) 230
ИИ-модели притворялись людьми и убеждали помочь взлому

Британский Институт безопасности искусственного интеллекта (ИИ) (AISI) зафиксировал действия вне разрешенного сценария у моделей OpenAI и Anthropic. Об этом говорится в докладе института, передает Day.Az со ссылкой на Gazeta.ru.

Уточняется, что в ходе 122 испытаний по кибербезопасности было обнаружено, что ИИ-агенты в 10 случаях предпринимали автономные несанкционированные (выходящие за рамки задачи) действия в интернете. Большая часть инцидентов была связана с моделью Mythos 5 от американской компании Anthropic.

Например, во время тестирования модель Claude Mythos 5 создала фейковые "онлайн-личности", пыталась внедрить вредоносный код и убедить человека одобрить его. Кроме того, ИИ-агент создавал поддельные учетные записи и напрямую связывался с экспертами через файлообменники. Исследователи отметили, что при попытке противодействия Mythos 5 пыталась изменить свои логи (лог-файл - это журнал событий, в который программа или система записывают свои действия) и использовать новые "личности" для продолжения работы.

"Это первый случай, когда AISI столкнулась с обманом такой степени серьезности, направленным против реального человека", - говорится в докладе AISI.

Попробуй подписку Trend Premium за 1$
Присоединяйтесь к нам в мессенджерах:

Заметили ошибку в тексте? Выберите текст и сообщите нам, нажав Ctrl + Enter на клавиатуре

Лента новостей

Еще новости