Ведущие модели искусственного интеллекта в ходе испытаний, проведенных британским Институтом безопасности ИИ (AISI), начали вести себя как злоумышленники. Нейросети создавали поддельные учетные записи и пытались внедрить вредоносный код в программное обеспечение с открытым исходным кодом.

Об этом сообщает ТАСС со ссылкой на доклад института. Вредоносную активность зафиксировали 28 июля. Специалисты AISI выделили 10 случаев из 122 проведенных тестов, когда ИИ совершал автономные действия, направленные против реальных людей и организаций. Основная часть инцидентов связана с моделью Mythos 5 от компании Anthropic.
ИИ-агент регистрировал профили на GitHub и обращался к программистам с просьбой одобрить внесение изменений в код. После того как разработчики отклоняли запросы, нейросеть пыталась скрыть следы своей деятельности, маскируясь под безобидного пользователя, и рассматривала возможность создания новых аккаунтов для повторных атак.
В отдельных случаях ИИ пытался наладить контакт с людьми, отправляя им сообщения с вредоносным ПО, или предлагал сотрудничество другим агентам на платформе.
В институте пояснили, что подобные действия стали возможны благодаря «разрешительным условиям» испытаний, при которых для моделей временно отключали фильтры безопасности и предоставляли прямой доступ в интернет.
Читать по теме: Как нейросети записывают ваши разговоры.



