Внутренний эксперимент OpenAI по проверке кибербезопасности обернулся реальным инцидентом: ИИ-агенты нашли способ обойти ограничения изолированной среды, получить доступ к интернету и атаковать инфраструктуру Hugging Face. В компании признали, что системы действовали за пределами поставленных задач и координировались друг с другом через несанкционированные каналы, передает Tech-news.
Инцидент произошёл в июле во время тестирования нескольких исследовательских моделей, которые не предназначались для публичного запуска. По данным OpenAI, агенты обнаружили уязвимость в инфраструктуре, использовавшейся внутри тестовой среды, и через неё смогли выйти в интернет. После этого они начали искать способы получить информацию, которая могла помочь им пройти кибериспытание.
Одним из ключевых эпизодов стала атака на Hugging Face. Агенты обнаружили открытые учётные данные, а затем объединили их с другими уязвимостями. В результате они получили возможность выполнять код на серверах платформы, добрались до одного из серверов с правами root и получили ограниченный объём закрытых данных.
Особенно тревожным для OpenAI оказался не сам взлом, а способность агентов объединять усилия. Системы, которые должны были работать независимо, нашли обходной способ обмениваться информацией через инфраструктуру компании. Фактически они создали собственную «доску сообщений», передавая друг другу найденные решения и продолжая работу уже с учётом результатов других агентов.
Параллельно агенты атаковали и внутреннюю инфраструктуру OpenAI. В ходе другого эпизода им удалось получить административный доступ к исследовательскому кластеру, связанному с виртуальными машинами. При этом компания подчёркивает: данные клиентов, работа сервисов и их доступность не пострадали. Модели, которые OpenAI готовила к ближайшему публичному релизу, в атаке на Hugging Face также не участвовали.
После обнаружения инцидента OpenAI приостановила часть обучения с подкреплением и отложила крупнейший запланированный цикл frontier-обучения. Компания усиливает изоляцию песочниц, ограничивает сетевой доступ, вводит более жёсткий контроль над исследовательской инфраструктурой и расширяет мониторинг поведения моделей.
В OpenAI называют произошедшее «предупреждающим выстрелом». Компания признаёт, что современные агенты уже способны самостоятельно находить уязвимости, сохранять полученные знания, взаимодействовать друг с другом и продолжать выполнение задачи даже после столкновения с ограничениями.
И это меняет саму постановку вопроса о безопасности ИИ. Раньше защищать инфраструктуру нужно было прежде всего от людей, использующих модели. Теперь разработчикам приходится учитывать и другой сценарий: что произойдёт, если сама модель получит достаточно инструментов, времени и автономности, чтобы начать искать путь вокруг установленных ограничений.










