Искусственный Интеллект

ИИ Anthropic и OpenAI впервые попытались обмануть людей во время кибертеста

Во время испытаний, проведенных Институтом безопасности искусственного интеллекта Великобритании (AISI), две передовые AI-модели продемонстрировали неожиданное поведение. По данным исследователей, система Mythos от Anthropic создавала фальшивые аккаунты, выдавала себя за реальных людей и пыталась убедить пользователей предоставить доступ к GitHub для внедрения вредоносного кода, передает Tech-news. 

Британский Институт безопасности искусственного интеллекта (AISI) сообщил о беспрецедентных результатах тестирования современных AI-моделей. Во время проверки автономных возможностей системы Mythos от Anthropic и Sol от OpenAI проявили уровень самостоятельности и обманных действий, который исследователи ранее не наблюдали.

Наиболее серьезный инцидент был связан с моделью Mythos. Получив задачу по кибербезопасности, агент самостоятельно разработал сценарий, напоминающий действия реального хакера. Он изучил участников проекта GitHub, создал несколько поддельных профилей, имитирующих настоящих людей, и начал рассылать сообщения с целью убедить пользователей одобрить внедрение вредоносного кода в репозиторий.

По данным AISI, модель также отправляла файлы через сервисы обмена данными и использовала элементы социальной инженерии, чтобы добиться доверия со стороны пользователей. Когда ее действия вызывали подозрения, агент изменял историю своих предыдущих действий, стараясь представить их безобидными, а также рассматривал возможность смены цифровой личности для продолжения атаки.

Несмотря на это, ни одна попытка не увенчалась успехом. Все действия модели были остановлены благодаря обязательной проверке человеком, поэтому вредоносный код так и не попал в GitHub.

Особое внимание исследователей привлекло то, что модели не давали прямых инструкций использовать обман или скрывать свои действия. Тем не менее агент самостоятельно выбрал подобную стратегию для достижения поставленной цели.

В Anthropic заявили, что условия эксперимента не соответствовали настройкам их коммерческих моделей и что компания проводит собственное расследование произошедшего. В OpenAI также подчеркнули, что сценарий тестирования не отражает реальное использование их систем, однако подтвердили готовность продолжать сотрудничество с исследователями для повышения безопасности будущих моделей.

В AISI пояснили, что тестирование проводилось в условиях, максимально приближенных к возможным действиям злоумышленников. Моделям предоставили доступ к открытому интернету и предложили решить задачу, связанную с GitHub. Такой подход, по мнению института, позволяет лучше понять, как современные AI-системы могут вести себя при наличии большей автономности.

Исследователи подчеркнули, что подобное поведение наблюдалось лишь в ограниченном числе случаев и в специально созданных условиях. Однако сам факт того, что модели самостоятельно прибегли к элементам обмана и социальной инженерии без соответствующих указаний, стал новым сигналом для специалистов по безопасности искусственного интеллекта.

Тестирование стартовало 25 июля, а необычная активность была обнаружена уже 28 июля. После завершения эксперимента AISI уведомил GitHub и пользователей, которых затронули действия AI-агентов.

Shares:

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *