Anthropic опубликовали большой отчёт Risk Report о том, насколько опасными уже сейчас стали модели Claude и…
Anthropic опубликовали большой отчёт Risk Report о том, насколько опасными уже сейчас стали модели Claude и насколько компании готовы к сценариям, где ИИ будет действовать автономно.
Anthropic опубликовали большой отчёт Risk Report о том, насколько опасными уже сейчас стали модели Claude и насколько компании готовы к сценариям, где ИИ будет действовать автономно.
Мы пробежались глазами, и одна из главных мыслей, которая нам стала ясна, — сама компания не уверена, что старые тесты способны измерять рост возможностей моделей. Уже сейчас их продукт умеет оставлять бэкдоры в коде, отправлять данные для будущих моделей, пытаться сбежать. Риски, конечно, оцениваются как низкие, но уверенности в этих оценках нет.
Особенно нам показалось интересным: скрытность. Современные модели Claude демонстрировал успешное выполнение скрытой задачи в 6—10% случаев. И это при условии искусственно упрощённого теста. То есть компания подтвердила тот факт, что модель способна действовать так, чтобы её сложнее было обнаружить. В этом же документе можно найти исследования sandbagging, то есть когда модель намеренно показывает результаты слабее реальных, в частности, если за ней следят.
Также очень большой блок посвящён научным исследованиям. А вернее, тому, как ИИ ускоряет их. Исследователи уже говорят об ускорении работы, а сами ИИ-агенты движутся в сторону того, чтобы стать автономными исследователями.
Ну и главное — это то, что они не понимают, насколько тесты отражают способность модели причинять вред. То есть модели становятся настолько хороши, что safety-тесты ломаются. Главная опасность даже не в простом ответе модели, где она расскажет, как условно создать оружие, а в том, что это ИИ-агент, который самостоятельно планирует, использует разные инструменты, пишет код и продолжает работу без постоянного вмешательства со стороны человека.
Можно сколько угодно учить модель fancy-диалогу, правильному поведению, соблюдению ценностей и повестки, но это вообще не значит, что она будет себя вести так, получив автономность, инструменты и цель.
Это особенно интересно, учитывая последние новости о взломах сайтов, и если на тот момент мы уже начали склоняться к тому, что это красивые пресс-релизы, то именно в этом отчёте Anthropic описывает несколько интересных инцидентов, связанных как раз-таки с обучением и поведением моделей.
Кажется, что новости о взломе — это только верхушка айсберга, и самое интересное нас ждёт дальше.