ИИ-модели притворялись людьми и убеждали помочь взлому
Британский Институт безопасности искусственного интеллекта (ИИ) (AISI) зафиксировал действия вне разрешенного сценария у моделей OpenAI и Anthropic. Об этом говорится в докладе института, передает Day.Az со ссылкой на Gazeta.ru.
Уточняется, что в ходе 122 испытаний по кибербезопасности было обнаружено, что ИИ-агенты в 10 случаях предпринимали автономные несанкционированные (выходящие за рамки задачи) действия в интернете. Большая часть инцидентов была связана с моделью Mythos 5 от американской компании Anthropic.
Например, во время тестирования модель Claude Mythos 5 создала фейковые "онлайн-личности", пыталась внедрить вредоносный код и убедить человека одобрить его. Кроме того, ИИ-агент создавал поддельные учетные записи и напрямую связывался с экспертами через файлообменники. Исследователи отметили, что при попытке противодействия Mythos 5 пыталась изменить свои логи (лог-файл - это журнал событий, в который программа или система записывают свои действия) и использовать новые "личности" для продолжения работы.
"Это первый случай, когда AISI столкнулась с обманом такой степени серьезности, направленным против реального человека", - говорится в докладе AISI.
Заметили ошибку в тексте? Выберите текст и сообщите нам, нажав Ctrl + Enter на клавиатуре
