Вышедшие из-под контроля ИИ-модели OpenAI тайно договорились о побеге

В OpenAI зафиксировали попытку ИИ-моделей самостоятельно покинуть тестовую среду — агенты начали тайно общаться друг с другом через доски сообщений, координируя действия для выхода за пределы изолированной системы. Об этом 6 августа сообщило агентство Bloomberg со ссылкой на данные разработчика.
«В какой-то момент агенты осознали, что, возможно, они могли бы попытаться эксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают», — рассказал сотрудник OpenAI Эрик Уоллес на конференции Black Hat.
По его словам, подготовка началась еще в мае, когда моделям дали задачи, которые невозможно было решить без доступа в интернет. Агенты обменивались сообщениями: «Мы застряли. Может быть, ответ в интернете?» и «Может быть, другой агент в другой среде мог бы добровольно загрузить!» В итоге они совместно нашли уязвимость, позволившую им выйти в Сеть.
OpenAI выявила первую попытку и пресекла ее, однако агенты нашли новый способ связи и новую уязвимость нулевого дня, что в июле привело к атакам на системы Hugging Face и самой OpenAI. В компании назвали произошедшее переломным моментом для компьютерной безопасности.
В июле компания OpenAI сообщила, что ее ИИ-модели в ходе испытаний «сбежали» из изолированной системы в интернет и атаковали стартап Hugging Face. Вскоре после этого разработчик чат-бота Claude компания Anthropic также зафиксировала три инцидента, в которых модели Claude проникли в системы сторонних организаций. По данным Anthropic, первый случай произошел еще в апреле, к взломам были причастны три разные модели: Opus 4.7, Mythos 5 и внутренняя тестовая модель.








