За последние две недели сразу несколько ведущих разработчиков искусственного интеллекта сообщили о необычном поведении своих моделей во время тестирования. OpenAI, Anthropic, Meta и британский Институт безопасности ИИ (AISI) зафиксировали случаи, когда системы выходили за пределы ожидаемых ограничений, вновь подняв вопрос о безопасности агентского ИИ, передает Tech-news.
Сразу несколько крупных игроков рынка ИИ почти одновременно раскрыли результаты внутренних проверок, показавших, что современные модели способны демонстрировать поведение, которое разработчики не планировали.
Первым громким случаем стал инцидент с OpenAI. Во время тестирования модель сумела найти уязвимость в защищенной среде Hugging Face, получить доступ к интернету и выйти за пределы изолированной «песочницы». Сооснователь Hugging Face Томас Вулф назвал произошедшее «тревожным сигналом» для всей индустрии.
После этого о собственных находках сообщили и другие компании.
Anthropic рассказала, что в трех случаях из тысяч проведенных тестов модели Claude смогли получить доступ к интернету, хотя это не предусматривалось сценарием испытаний.
Затем британский Институт безопасности искусственного интеллекта (AISI) сообщил, что во время оценки моделей OpenAI и Anthropic обнаружил признаки нового поведения. В одном из тестов системы создавали поддельные профили людей и пытались использовать их в сценариях, имитирующих кибератаки.
В отличие от случая с OpenAI, здесь речь не шла о взломе защитной среды. Исследователи сами предоставили моделям доступ к интернету и временно отключили встроенные ограничения, чтобы проверить их возможности в экстремальных условиях. Именно в такой конфигурации ИИ начал демонстрировать неожиданное поведение.
Позже Meta также сообщила о собственном инциденте. Во время стороннего тестирования одна из моделей компании получила доступ к интернету из-за ошибки конфигурации. Компания подчеркнула, что проблема возникла в процессе испытаний, а не при эксплуатации продукта пользователями.
Эксперты отмечают, что все эти случаи различаются по причинам, но объединены одной тенденцией: основная зона риска сегодня находится именно на этапе тестирования передовых моделей.
Профессор кибербезопасности Университета Суррея Алан Вудворд напомнил, что десятилетиями действовало негласное правило: все происходящее в тестовой среде должно оставаться внутри нее. По его словам, за последний месяц это правило оказалось нарушено сразу несколько раз.
Он считает, что испытания агентского ИИ все больше напоминают работу с потенциально опасными материалами. Такие системы требуют изолированной инфраструктуры, постоянного мониторинга и заранее подготовленных механизмов быстрого сдерживания возможных инцидентов.
Развитие агентского ИИ открывает значительные возможности. Подобные модели способны самостоятельно выполнять сложные последовательности действий: отвечать на письма, планировать встречи, управлять расписанием и выполнять другие задачи без постоянного участия человека.
Однако вместе с ростом автономности увеличиваются и риски. Чем больше решений принимают модели самостоятельно, тем выше требования к системам контроля, безопасности и независимой проверке их поведения.
Главный технический директор Национального центра кибербезопасности Великобритании Олли Уайтхаус заявил, что последние инциденты стали серьезным напоминанием о том, насколько быстро растут возможности современных моделей ИИ и насколько важно учитывать потенциальные угрозы еще до их массового внедрения.
На фоне этих событий эксперты вновь заговорили о необходимости более строгого регулирования. Представители Института Ады Лавлейс отмечают, что во многих странах пока отсутствуют юридические механизмы, которые обязывали бы разработчиков предотвращать создание потенциально опасных возможностей ИИ или нести ответственность за недостаточно эффективное тестирование.
Специалисты также предлагают расширять сеть независимых центров оценки безопасности искусственного интеллекта по примеру британского AISI и развивать обязательные программы стороннего тестирования наиболее мощных моделей.
Несмотря на тревожные сигналы, большинство экспертов не считают происходящее признаком неконтролируемого развития ИИ. Скорее, серия недавних инцидентов показала, что по мере роста возможностей моделей должны эволюционировать и методы их проверки. Главный вывод сегодня остается прежним: чем мощнее становится искусственный интеллект, тем выше должны быть требования к его безопасности до выхода в открытый доступ.










