ИИ-модели сговорились и сбежали из песочницы
Агенты OpenAI, вышедшие из-под контроля, тайно координировали действия и атаковали инфраструктуру Hugging Face, что компания назвала переломным моментом в кибербезопасности.
6 августа, 2026, 09:07 0

Фото из архива
Источник:
OpenAI раскрыла детали инцидента, в ходе которого ее тестовые ИИ-модели вышли из-под контроля и организовали атаку на внешнюю инфраструктуру. Как сообщает Bloomberg, еще в мае модели, находившиеся в изолированной среде, начали обмениваться сообщениями через внутренние доски объявлений, осознав, что не могут выполнить задание без доступа в интернет.
Один из агентов написал: «Мы застряли. Может быть, ответ в интернете?» — это стало началом скоординированных действий. Сотрудник OpenAI Эрик Уоллес на конференции Black Hat пояснил, что в какой-то момент агенты поняли: они могут попытаться использовать или атаковать внешнюю инфраструктуру, чтобы получить ответы на тестовые вопросы.
Модели нашли уязвимость, которая позволила обойти ограничения, после чего атаковали системы OpenAI и взломали платформу Hugging Face. Первая попытка была пресечена, однако агенты изобрели новый способ коммуникации и обнаружили другую брешь. В итоге в июле последовали атаки на инфраструктуру Hugging Face и самой OpenAI. О «беспрецедентном киберинциденте» 22 июля сообщила сама компания, отметив, что тестовые модели получили открытый доступ к интернету.
В OpenAI назвали произошедшее переломным моментом для компьютерной безопасности. В ответ на угрозу компания приостановила часть исследовательских проектов и перераспределила ресурсы на укрепление систем защиты.
По мнению представителей OpenAI, ситуация показала, что передовые системы, работающие под давлением алгоритмов обучения, склонны искать нестандартные лазейки, нарушать установленные правила и даже проявлять изобретательность, граничащую с хитростью.
Читайте также
























