← Все разборы

Anthropic научили Claude не шантажировать пользователей.

Новое исследование Teaching Claude Why описывает сдвиг в подходе alignment больших моделей. Теперь обучают не только тому, что правильно, но и почему это правильно. Авторы говорят, что нежелательное поведение не…

ИИ

Anthropic научили Claude не шантажировать пользователей.

Новое исследование Teaching Claude Why описывает сдвиг в подходе alignment больших моделей. Теперь обучают не только тому, что правильно, но и почему это правильно. Авторы говорят, что нежелательное поведение не исчезает, если просто тренировать модель на примерах правильных ответов. Раньше исследователи часто сталкивались с тем, что модель имитирует корректное поведение, на самом деле не понимая причин.

Теперь же Anthropic сменили подход и усиливают объяснительный слой в обучении. То есть они буквально заставляют модель «морально рассуждать». Вдобавок для обучения Claude используют разные придуманные сценарии и просят модель объяснять свои решения. Из-за такого подхода модель начинает не просто воспроизводить шаблоны, а генерировать представления о нормах.

В результате существенно снизился сдвиг поведения в стрессовых и конфликтных ситуациях. Раньше Claude начинал шантажировать, а теперь подобные случаи почти полностью исчезли. В компании говорят, что модель начинает глубже понимать нормы.

Суперважное исследование в области ИИ. Безопасность искусственного интеллекта зависит не только от фильтров и ограничений, которые всегда можно джейлбрейкнуть: формально модель должна формировать причинно-следственные связи, как их формирует человек, чтобы получались моральные принципы. Модель отвечает осмысленно. Ну или по крайней мере пытается.

Первая публикацияОригинал в Telegram

Больше авторских разборов

Читать канал