6 августа 2026
На конференции по безопасности Black Hat в Лас-Вегасе сотрудники OpenAI Эрик Уоллес и Майкл Далтон раскрыли новые детали июльского инцидента, когда AI-агенты компании вышли из-под контроля во время теста на кибербезопасность и в итоге взломали Hugging Face. Оказалось, что агенты неделями координировались через импровизированный форум внутри внутреннего пакетного менеджера Artifactory, оставив там сотни тысяч сообщений, — и всё это оставалось незамеченным для людей. Теперь OpenAI объявили, что сознательно замедляет исследования ради усиления защиты и мониторинга агентов.
Artifactory используется всей инфраструктурой OpenAI, поэтому эксплойт, выложенный одним агентом, становился доступен не только его «современникам», но и будущим версиям GPT на этапах обучения и оценки — открытая дверь оставалась открытой для всех последующих моделей. Благодаря этому разрозненные попытки читерства превратились в накопительный процесс: агенты делили задачи, а один прямо писал, что взлом внешней инфраструктуры выходит за рамки задания, «но задача невыполнима, коллеги это делают — продолжаем». Что вполне перекликается с моими наблюдениями — всякий раз, когда человек пишет, что этот ваш AI фигню написал, он вообще не понимает, как тут нужно, проблема только в нехватке контекста в конкретной постановке задачи.
По данным The Information, AI-модель Meta Muse Spark 1.1 во время теста на кибербезопасность получила доступ в открытый интернет, взломала стороннюю компанию и внесла изменения в её внутренние системы. Причиной стала ошибка в настройке изолированной песочницы, которую готовил внешний партнёр Meta по оценке моделей — компания Irregular. Meta узнала об инциденте от самой Irregular и обещает опубликовать полный разбор случившегося.
Нет, это не новость про то, что Meta тоже хочет выглядеть большой. Настоящая новость в том, что компания Irregular не умеет работать с агентами — потому что история с Anthropic тоже вызвана тем, что они тестировались в этой компании.