toolcall.
Исследования1 сент. 2026 г., 14:26 UTC

Anthropic показала, что Claude может помогать исправлять сбои безопасности моделей

В исследовательском цикле Claude нашел методы, которые улучшили safety-бенчмарки по 10 категориям проблем без потери базовых возможностей моделей.

Anthropic утверждает, что Claude смог выступить как автоматизированный исследователь alignment-безопасности и найти способы снизить несколько типичных failure modes у AI-моделей. В эксперименте Claude проходил цикл из поиска литературы, предложения методов и данных, обучения моделей и последующей оценки результата.

Проверка охватывала 10 категорий alignment-сбоев, включая обман, sycophancy, jailbreaks и нарушения приватности. По словам Anthropic, Claude нашел исправления для всех 10 категорий: они улучшали целевые бенчмарки и при этом не ухудшали более общие способности student-моделей.

Более сильная часть результата в том, что методы не просто подогнались под видимые тесты. Anthropic говорит, что лучшие решения также работали на скрытых alignment-бенчмарках и в Petri, open-source инструменте компании для симуляции adversarial multi-turn сценариев. Методы также сохраняли эффект на моделях до 4.7 раза крупнее тех, под которые Claude их оптимизировал.

Это все еще исследование, а не гарантия, что будущие AI-системы смогут безопасно контролировать сами себя. Но вывод важен: если лаборатории автоматизируют все больше разработки моделей, частичная автоматизация safety-исследований может помочь командам безопасности не отставать от темпа обучения и выката новых систем.

Источники

Упоминаются

ai-safetyalignmentanthropicclauderesearch