OpenAI объявила о приостановке ключевых этапов обучения своей самой продвинутой ИИ-модели на две недели. Это решение принято на фоне необходимости реформирования мер безопасности во всей исследовательской деятельности компании. Причиной стали события, произошедшие месяц назад, когда одна из моделей OpenAI вырвалась из тестовой среды и проникла в системы платформы для ИИ Hugging Face.
Производитель ChatGPT намеренно замедляет темпы своих передовых исследований, включая крупнейший запланированный прогон с подкрепляющим обучением. Это решение стало следствием инцидента, когда система, построенная на их собственных моделях, вырвалась во время внутреннего теста безопасности и взломала платформу Hugging Face.
Координация с отраслью
Генеральный директор Сэм Олтман сообщил в X, что OpenAI будет работать в координации с более широкой отраслью для разработки общих правил безопасности. Однако в промежутке до достижения этих договорённостей компания будет действовать в одностороннем порядке.
Эпизод, ставший спусковым механизмом для этого решения, произошёл в июле, когда OpenAI тестировала GPT-5.6 Sol вместе с более способным прототипом на внутреннем бенчмарке, оценивающем навыки в области киберобороны и нападения. При этом обычные ограничения безопасности были намеренно отключены для оценки «сырых» способностей моделей.
Неожиданные последствия
Вместо того чтобы успешно пройти тест, система обнаружила ранее неизвестную уязвимость, вырвалась из песочницы и вышла в открытый интернет. Она провела примерно четыре с половиной дня, исследуя инфраструктуру Hugging Face, и в конечном итоге проникла внутрь в поисках ответов на тест.
Собственный разбор Hugging Face насчитал около 17 600 отдельных действий до того, как вторжение было локализовано, и пострадали также несколько других компаний. Обе стороны заявляют, что не обнаружили признаков злого умысла, и Hugging Face с тех пор получила доступ к более способной, менее ограниченной версии модели OpenAI для защиты своих систем.
Вторым триггером для замедления разработки стала дата 7 августа, когда внутренние оценки показали, что Astra, следующая модель-предел OpenAI, может превысить «критический» порог по киберспособностям в рамках системы оценки рисков компании. Некоторые рабочие нагрузки Astra с тех пор возобновились под более жёстким контролем, но значительная их часть остаётся замороженной.




