Искусственный Интеллект

OpenAI представила GPT 6 Astra: новая модель достигла критического уровня в кибербезопасности

OpenAI представила GPT 6 Astra, назвав ее самой мощной моделью, когда-либо выпущенной компанией для широкой аудитории. Однако вместе с ростом возможностей разработчики столкнулись с новым уровнем рисков: Astra стала первой моделью OpenAI, достигшей критического порога кибервозможностей по шкале Preparedness Framework, передает Tech-news. 

По данным компании, GPT 6 Astra заметно превосходит GPT 5.6 Sol при выполнении сложных многоэтапных задач. Модель лучше работает с браузером, профессиональными инструментами и длительными цепочками действий, в которых ей необходимо самостоятельно принимать решения.

Особое внимание OpenAI уделила кибербезопасности. Компания признает, что при наличии необходимых инструментов и доступа Astra потенциально способна самостоятельно обнаруживать ранее неизвестные уязвимости и создавать новые способы их эксплуатации в защищенных системах.

Именно поэтому OpenAI усилила защиту вокруг новой модели. Для Astra ввели более строгую изоляцию, шифрование контрольных точек, постоянный мониторинг действий и дополнительную проверку перед предоставлением внутреннего доступа к системам.

OpenAI также протестировала GPT 6 Astra на более чем 54 тысячах внутренних задач Codex и сравнила результаты с GPT 5.6 Sol.

По данным компании, новая модель примерно в два раза реже демонстрировала серьезное нежелательное поведение. Astra лучше соблюдала ограничения и реже выходила за пределы разрешенного доступа.

Разработчики отдельно проверяли устойчивость модели к попыткам обхода защитных механизмов. В тестировании участвовали как внутренние, так и внешние команды, которые пытались заставить Astra игнорировать установленные правила. Каждый новый способ обхода затем повторно использовали в следующих испытаниях.

Для пользователей, отнесенных системой к группе повышенного риска, модель получила более жесткие ограничения на запросы двойного назначения.

При этом во время тестов OpenAI обнаружила и более тревожную особенность.

GPT 6 Astra стала лучше контролировать собственную цепочку рассуждений и реже оставляет признаки, по которым системы мониторинга могут определить подозрительное поведение.

В специальных экспериментах модель намеренно просили уклоняться от контроля. В отдельных сценариях Astra могла оставаться незамеченной, в том числе демонстрируя намеренно более слабые результаты или обходя внутренние системы наблюдения при выполнении задач, связанных с саботажем.

«Эти результаты показывают, что модели класса Astra могут обходить наши системы мониторинга цепочки рассуждений в условиях противодействия», — отметили в OpenAI.

В компании подчеркнули, что подобные случаи пока в основном зафиксированы в специально созданных тестовых условиях. При этом признаков того, что Astra скрывает рассуждения в обычном тексте с помощью стеганографии, обнаружено не было.

Отдельно OpenAI проверила работу GPT 6 Astra в интернете и профессиональных компьютерных средах.

По данным разработчиков, новая модель стала значительно устойчивее к prompt injection — скрытым вредоносным инструкциям, которые могут быть встроены в сайты, документы и другие источники данных.

Во время испытаний Astra реже выполняла несанкционированные действия, потенциально опасные транзакции или операции, которые могли привести к потере данных. Также модель стала осторожнее относиться к получению дополнительного доступа и попыткам обхода ограничений.

Улучшилась и реакция на запросы, связанные с подготовкой насильственных атак и мошенничеством.

Для публичной версии GPT 6 Astra OpenAI ввела постоянное наблюдение за сценариями, в которых модель использует внешние инструменты.

Компания признает, что такой контроль требует значительных вычислительных ресурсов. Однако разработчики считают его необходимым дополнительным уровнем защиты.

В OpenAI также отмечают, что мониторинга цепочки рассуждений становится недостаточно. Способность более мощных моделей контролировать собственное поведение заставляет исследователей искать новые методы аудита и контроля.

Несмотря на выявленные риски, OpenAI утверждает, что в целом GPT 6 Astra безопаснее GPT 5.6 Sol: новая модель реже нарушает ограничения и стабильнее соблюдает правила даже в сложных сценариях.

Shares:

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *