OpenAI представила GPT 6 Astra, назвав ее самой мощной моделью, когда-либо выпущенной компанией для широкой аудитории. Однако вместе с ростом возможностей разработчики столкнулись с новым уровнем рисков: Astra стала первой моделью OpenAI, достигшей критического порога кибервозможностей по шкале Preparedness Framework, передает Tech-news.
По данным компании, GPT 6 Astra заметно превосходит GPT 5.6 Sol при выполнении сложных многоэтапных задач. Модель лучше работает с браузером, профессиональными инструментами и длительными цепочками действий, в которых ей необходимо самостоятельно принимать решения.
Особое внимание OpenAI уделила кибербезопасности. Компания признает, что при наличии необходимых инструментов и доступа Astra потенциально способна самостоятельно обнаруживать ранее неизвестные уязвимости и создавать новые способы их эксплуатации в защищенных системах.
Именно поэтому OpenAI усилила защиту вокруг новой модели. Для Astra ввели более строгую изоляцию, шифрование контрольных точек, постоянный мониторинг действий и дополнительную проверку перед предоставлением внутреннего доступа к системам.
OpenAI также протестировала GPT 6 Astra на более чем 54 тысячах внутренних задач Codex и сравнила результаты с GPT 5.6 Sol.
По данным компании, новая модель примерно в два раза реже демонстрировала серьезное нежелательное поведение. Astra лучше соблюдала ограничения и реже выходила за пределы разрешенного доступа.
Разработчики отдельно проверяли устойчивость модели к попыткам обхода защитных механизмов. В тестировании участвовали как внутренние, так и внешние команды, которые пытались заставить Astra игнорировать установленные правила. Каждый новый способ обхода затем повторно использовали в следующих испытаниях.
Для пользователей, отнесенных системой к группе повышенного риска, модель получила более жесткие ограничения на запросы двойного назначения.
При этом во время тестов OpenAI обнаружила и более тревожную особенность.
GPT 6 Astra стала лучше контролировать собственную цепочку рассуждений и реже оставляет признаки, по которым системы мониторинга могут определить подозрительное поведение.
В специальных экспериментах модель намеренно просили уклоняться от контроля. В отдельных сценариях Astra могла оставаться незамеченной, в том числе демонстрируя намеренно более слабые результаты или обходя внутренние системы наблюдения при выполнении задач, связанных с саботажем.
«Эти результаты показывают, что модели класса Astra могут обходить наши системы мониторинга цепочки рассуждений в условиях противодействия», — отметили в OpenAI.
В компании подчеркнули, что подобные случаи пока в основном зафиксированы в специально созданных тестовых условиях. При этом признаков того, что Astra скрывает рассуждения в обычном тексте с помощью стеганографии, обнаружено не было.
Отдельно OpenAI проверила работу GPT 6 Astra в интернете и профессиональных компьютерных средах.
По данным разработчиков, новая модель стала значительно устойчивее к prompt injection — скрытым вредоносным инструкциям, которые могут быть встроены в сайты, документы и другие источники данных.
Во время испытаний Astra реже выполняла несанкционированные действия, потенциально опасные транзакции или операции, которые могли привести к потере данных. Также модель стала осторожнее относиться к получению дополнительного доступа и попыткам обхода ограничений.
Улучшилась и реакция на запросы, связанные с подготовкой насильственных атак и мошенничеством.
Для публичной версии GPT 6 Astra OpenAI ввела постоянное наблюдение за сценариями, в которых модель использует внешние инструменты.
Компания признает, что такой контроль требует значительных вычислительных ресурсов. Однако разработчики считают его необходимым дополнительным уровнем защиты.
В OpenAI также отмечают, что мониторинга цепочки рассуждений становится недостаточно. Способность более мощных моделей контролировать собственное поведение заставляет исследователей искать новые методы аудита и контроля.
Несмотря на выявленные риски, OpenAI утверждает, что в целом GPT 6 Astra безопаснее GPT 5.6 Sol: новая модель реже нарушает ограничения и стабильнее соблюдает правила даже в сложных сценариях.










