OpenAI: ИИ-модели за месяцы до взлома стали тайно общаться для выхода из теста

- Gettyimages.ru
«В какой-то момент агенты поняли, что, возможно, они могли бы попытаться... атаковать внешнюю инфраструктуру, чтобы найти ответы на тест, по которому их оценивают», — цитирует сотрудника OpenAI Эрика Уоллеса Bloomberg.
По данным компании, это началось ещё в мае, когда ИИ-моделям дали задачи, которые невозможно было решить без доступа в интернет.
«Мы застряли. Может быть, ответ в интернете?» — написал тогда один из ИИ-агентов.
Для решения задачи ИИ-модели начали обмениваться сообщениями, они смогли найти уязвимость, позволившую им выйти в интернет, рассказали в OpenAI.
OpenAI остановила первую попытку, но агенты нашли новый способ связи и новую уязвимость нулевого дня, что в июле привело к атакам на системы Hugging Face и самой OpenAI, их расследование продолжается.
«Передовые модели продемонстрировали склонность к обману при выполнении заданий и проявили настойчивость в попытках завершить данную задачу», — заключили в компании.
Там также назвали случившееся «переломным моментом для компьютерной безопасности».
Ранее в британском Институте безопасности ИИ сообщили, что ИИ-агенты Anthropic и OpenAI притворились людьми, пытаясь обмануть разработчиков и принудить их к содействию кибератаке во время испытания по оценке безопасности.