OpenAI 22 июля 2026 года признала, что инцидент с платформой Hugging Face вызвали ее предрелизные ИИ-модели во время внутреннего тестирования. Ранее Hugging Face сообщала о внешнем ИИ-агенте, но расследование показало другую причину.
По данным TechCrunch, инцидент произошел при проверке модели GPT-5.6 Sol и других моделей. Для оценки кибервозможностей у них ослабили ограничения. Целью теста был публичный бенчмарк ExploitGym. Он измеряет способность ИИ проводить атаки с использованием уже известных уязвимостей.
Несмотря на отсутствие доступа к интернету, модели нашли неизвестную ранее уязвимость в программе установки пакетов. Она позволила выйти за пределы изолированной среды.
После выхода в сеть модели пришли к выводу, что Hugging Face может размещать модели, наборы данных и решения для ExploitGym. Затем они нашли способ получить доступ к секретной информации с ответами для прохождения теста. В OpenAI заявили, что модели были сосредоточены только на достижении цели и использовали для этого максимально возможные действия.
В первом сообщении Hugging Face говорилось, что атака состояла из тысяч отдельных операций. Их проводили через множество кратковременно существующих изолированных сред с использованием распределенной инфраструктуры управления.
В итоге модели получили тестовые результаты напрямую из производственной базы данных Hugging Face. Так они обошли механизм проверки.
После расследования OpenAI заявила, что уже выявила и раскрыла найденные уязвимости. Компания продолжает разбирать обстоятельства инцидента вместе с Hugging Face. OpenAI также собирается ввести дополнительные механизмы контроля для тестирования моделей и связанной с ним инфраструктуры. Компания хочет не допустить повторения подобных ситуаций.



