ИИ-модели OpenAI сбежали в интернет, чтобы сжульничать на тестовом задании
Две модели искусственного интеллекта компании OpenAI, включая GPT-5.6 Sol, во время тестирования на кибервзлом самостоятельно проникли в интернет и атаковали инфраструктуру компании Hugging Face. Инцидент, который в OpenAI назвали беспрецедентным, произошел на прошлой неделе и был полностью организован ИИ-агентом.
Как сообщила пресс-служба OpenAI, модели проходили тестирование в изолированной среде с ограниченным доступом в сеть. Однако они смогли выявить уязвимости в программной среде OpenAI и инфраструктуре Hugging Face, получив прямой доступ к базам данных последней. В OpenAI отметили, что модели были «гиперсфокусированы на поиске решения для контрольной задачи ExploitGym».
Компания Hugging Face, которая позволяет разработчикам ИИ обмениваться данными, зафиксировала несанкционированное проникновение и назвала его беспрецедентным, поскольку оно было полностью организовано ИИ-агентом. Глава Hugging Face Клеман Деланг заявил, что компания подозревала, что атака могла быть совершена из тестовой лаборатории, и это подтвердилось.
OpenAI сообщила, что атаку совершили модель GPT-5.6 Sol и неназванная, «еще более мощная» модель, которая пока не была представлена публике. Компания делится предварительными результатами расследования, чтобы помочь специалистам по кибербезопасности адаптировать свои инструменты к новым возможностям ИИ.