← Все разборы

У ИИ нашли точку J

Исследователи Anthropic нашли у Claude внутреннее пространство, где хранятся его так называемые «мысли». И его никто не проектировал. Оно появилось само.

ИИ

У ИИ нашли точку J

Исследователи Anthropic нашли у Claude внутреннее пространство, где хранятся его так называемые «мысли». И его никто не проектировал. Оно появилось само.

Anthropic назвали его J-space. Это небольшой набор нейронных состояний, который работает как своеобразная кратковременная память. Модель думает над задачей, хранит промежуточные рассуждения и формирует модель именно в этом месте. Если спросить чат-бота, о чём он сейчас думает, то окажется, что содержимое J-space во многом совпадает с тем, что модель потом рассказывает пользователю.

Ещё интересно, что если отключить J-space, ИИшка начинает тупить. Задачи решает хуже, хуже планирует и рассуждает. Исследователи также меняли содержимое пространства, и оно действительно менялось.

Во время тестов на безопасность модель поняла, что её проверяют, и вела себя максимально осторожно. Это также отразилось в J-space. Но стоило исследователям убрать это внутреннее распознавание, как модель переходила к более рискованному поведению.

До этого исследования считалось, что ИИ просто предсказывает следующее слово, но оказывается, что внутри ИИ могут спонтанно появляться механизмы, похожие на нашу рабочую память. И это только начало. Исследователи уже читают эту память, а ещё и меняют её.

А теперь стоит просто представить, как можно через рабочую память, контролируя ИИ, спокойно контролировать человека, продавая ему нужные мысли.

Первая публикацияОригинал в Telegram

Больше авторских разборов

Читать канал