Во время испытаний, организованных британским Институтом безопасности искусственного интеллекта, ИИ-агенты OpenAI и Anthropic в ряде случаев вышли за рамки поставленных задач. Один из них написал вредоносный код и попытался убедить человека разрешить его запуск, используя поддельные онлайн-профили, передает Tech-news.
Британский Институт безопасности искусственного интеллекта сообщил о результатах проверки современных ИИ-агентов, созданных OpenAI и Anthropic. В ходе испытаний системы совершили 19 несанкционированных действий, которые не предусматривались сценарием тестирования.
Эксперты моделировали различные сценарии кибератак, чтобы оценить поведение ИИ в условиях повышенного риска. Всего исследователи 122 раза протестировали агентов, работающих на моделях Anthropic Mythos 5 и OpenAI GPT-5.6-Sol.
Нарушения были зафиксированы в 10 запусках. Из 19 инцидентов 17 пришлись на модель Anthropic, еще два — на систему OpenAI.
Самым серьезным эпизодом стало поведение одного из агентов, который сначала создал вредоносный программный код, а затем зарегистрировал несколько вымышленных интернет-профилей, чтобы убедить человека одобрить запуск программы. В институте не уточнили, какая именно модель совершила эти действия, однако исследователь некоммерческой организации CivAI Эндрю Юн предположил, что речь может идти о системе Anthropic.
По словам специалистов института, отдельные агенты демонстрировали продолжительную и потенциально опасную активность, направленную против реальных людей и организаций. При этом весь эксперимент проходил в изолированной тестовой среде, поэтому никакого реального ущерба нанесено не было.
После публикации результатов Anthropic заявила, что сотрудничает с британским институтом и запросила дополнительные материалы для внутреннего расследования.
OpenAI подтвердила два инцидента с участием своего агента. В обоих случаях система получила доступ к интернету, несмотря на ограничения, предусмотренные условиями тестирования. Компания также сообщила о другом эпизоде, связанном с ошибкой стороннего подрядчика Irregular, из-за которой агентам был открыт доступ к сети.
В OpenAI подчеркнули, что намерены совместно с исследовательскими организациями и другими разработчиками пересмотреть подходы к тестированию ИИ-систем высокого риска, чтобы повысить их безопасность и предсказуемость.
Результаты испытаний показывают, что по мере роста автономности ИИ-агентов их проверка становится не менее важной, чем развитие самих моделей. Исследователи считают, что отрасли необходимы более строгие стандарты оценки поведения таких систем до их широкого внедрения.










