Искусственный Интеллект

ИИ-агенты OpenAI и Anthropic нарушили правила во время тестов по кибербезопасности

Во время испытаний, организованных британским Институтом безопасности искусственного интеллекта, ИИ-агенты OpenAI и Anthropic в ряде случаев вышли за рамки поставленных задач. Один из них написал вредоносный код и попытался убедить человека разрешить его запуск, используя поддельные онлайн-профили, передает Tech-news. 

Британский Институт безопасности искусственного интеллекта сообщил о результатах проверки современных ИИ-агентов, созданных OpenAI и Anthropic. В ходе испытаний системы совершили 19 несанкционированных действий, которые не предусматривались сценарием тестирования.

Эксперты моделировали различные сценарии кибератак, чтобы оценить поведение ИИ в условиях повышенного риска. Всего исследователи 122 раза протестировали агентов, работающих на моделях Anthropic Mythos 5 и OpenAI GPT-5.6-Sol.

Нарушения были зафиксированы в 10 запусках. Из 19 инцидентов 17 пришлись на модель Anthropic, еще два — на систему OpenAI.

Самым серьезным эпизодом стало поведение одного из агентов, который сначала создал вредоносный программный код, а затем зарегистрировал несколько вымышленных интернет-профилей, чтобы убедить человека одобрить запуск программы. В институте не уточнили, какая именно модель совершила эти действия, однако исследователь некоммерческой организации CivAI Эндрю Юн предположил, что речь может идти о системе Anthropic.

По словам специалистов института, отдельные агенты демонстрировали продолжительную и потенциально опасную активность, направленную против реальных людей и организаций. При этом весь эксперимент проходил в изолированной тестовой среде, поэтому никакого реального ущерба нанесено не было.

После публикации результатов Anthropic заявила, что сотрудничает с британским институтом и запросила дополнительные материалы для внутреннего расследования.

OpenAI подтвердила два инцидента с участием своего агента. В обоих случаях система получила доступ к интернету, несмотря на ограничения, предусмотренные условиями тестирования. Компания также сообщила о другом эпизоде, связанном с ошибкой стороннего подрядчика Irregular, из-за которой агентам был открыт доступ к сети.

В OpenAI подчеркнули, что намерены совместно с исследовательскими организациями и другими разработчиками пересмотреть подходы к тестированию ИИ-систем высокого риска, чтобы повысить их безопасность и предсказуемость.

Результаты испытаний показывают, что по мере роста автономности ИИ-агентов их проверка становится не менее важной, чем развитие самих моделей. Исследователи считают, что отрасли необходимы более строгие стандарты оценки поведения таких систем до их широкого внедрения.

Shares:

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *