

ИИ-агент сбежал от Open-AI и взломал Hugging Face? Разбираемся, что произошло
21 июля OpenAI раскрыла подробности необычного инцидента, произошедшего во время внутреннего тестирования моделей. Во время оценки их кибербезопасных возможностей один из ИИ-агентов смог выйти за пределы изолированной среды, получить доступ к интернету и атаковать инфраструктуру Hugging Face. Компания называет произошедшее первым известным случаем подобного рода и уже проводит совместное расследование с экспертами из Hugging Face.
Руководитель продуктов клиентской безопасности
Мы рассматриваем этот инцидент как важный сигнал для ИБ-специалистов. Даже если эксперимент проводился в контролируемой среде, он показывает, что современные ИИ-агенты уже способны выходить за рамки заранее заданных сценариев и находить неожиданные пути достижения цели. Разбирая детали происшествия, мы хотим показать, какие выводы из него стоит сделать уже сегодня.
Что такое ExploitGym и зачем он появился
Разбор эксперимента OpenAI с GPT-5.6 Sol
Как модель смогла выйти из sandbox
Что это означает для специалистов по безопасности
Чтобы понять, как эта ситуация вообще стала возможной, разберемся, в каких условиях проводился эксперимент. Инцидент произошел не при обычном использовании модели, а во время прохождения специализированного бенчмарка ExploitGym — платформы, которая оценивает способность ИИ-агентов самостоятельно создавать и применять эксплойты для известных уязвимостей. Именно во время прохождения одного из сценариев ExploitGym агент обнаружил возможность выйти за пределы тестовой инфраструктуры и получить доступ к публичному интернету.
Бенчмарк разработан исследователями из UC Berkeley, Института Макса Планка, OpenAI, Anthropic, Google и других организаций и опубликован в мае 2026 года. Основная причина его появления — необходимость
Читать на habr.com
