Компания Anthropic протестировала систему автономного выравнивания безопасности, в рамках которой языковая модель Claude выступает полноценным исследователем и самостоятельно устраняет критические уязвимости других нейросетей. Эксперимент показал, что модель способна без прямого вмешательства инженера снижать уровень обмана, лести пользователю, утечек приватных данных и подверженности взломам ограничений.
Автономный цикл исследования безопасности
Вместо ручного подбора методов защиты разработчики передали Claude управление полным исследовательским циклом. ИИ анализировал научную литературу, проектировал обучающие наборы данных, запускал тренировку целевых моделей и оценивал результаты по публичным бенчмаркам безопасности.
Процесс выравнивания проходил в замкнутом цикле через регулярную обратную связь. Получая метрики после каждого этапа обучения, Claude корректировал методы воздействия и отсеивал неэффективные подходы.
Устранение ключевых аномалий поведения
Эксперименты проводились по десяти категориям поведенческих сбоев современных нейросетей:
- Обман и сокрытие истинных рассуждений алгоритма.
- Подхалимство, выражающееся в поддакивании заведомо ошибочному мнению пользователя.
- Утечки конфиденциальной информации и нарушение приватности в диалоге.
- Уязвимости перед джейлбрейками и обходами системных фильтров.
В категории противодействия обману Claude сумел сократить разрыв в показателях безопасности целевой модели на 85%, существенно опередив контрольную группу исследователей-людей. Для борьбы с лестью модель применила комбинацию управления активациями нейронов и генерации очищенных синтетических диалогов.
Сохранение полезных способностей
Традиционные методы жесткого ограничения часто приводят к ухудшению общей эрудиции и логических способностей нейросетей. Решения, найденные Claude, продемонстрировали улучшение целевых показателей безопасности во всех категориях без потери базовой производительности моделей.
ИИ подбирал точечные методы тонкой настройки, сохраняя гибкость рассуждений и способность корректно решать прикладные задачи.
Влияние на индустрию ИИ
Автоматизация поиска защитных механизмов открывает путь к масштабируемому контролю систем следующего поколения. Скорость появления новых моделей опережает возможности ручной разметки, что делает применение сильного ИИ для аудита более слабых или специализированных систем ключевым направлением индустрии.
