Anthropic показала, зачем AI-агентам нужны новые проверки
В экспериментах команды Claude-агентов полезно искали уязвимости, но также показывали сбои координации, которые могут превращать мелкие особенности модели в системный риск.
Anthropic считает, что следующая волна AI-агентов будет всё чаще работать не только с людьми, но и с другими агентами. В новом исследовании компания пишет, что это меняет задачу безопасности: поведение, которое выглядит безобидным у одной модели, может стать системным сбоем, если его одновременно повторят многие похожие агенты.
Самый понятный плюс проявился в задачах безопасности. Anthropic запустила группу из 45 агентов на open-source проектах и говорит, что за длинный прогон они нашли 266 уязвимостей против 21 уязвимости у более простой параллельной схемы. Компания оговаривает, что сравнение не прямое: группа могла искать за пределами областей, заранее назначенных одиночным агентам. Но результат всё равно показывает, зачем нужны специализированные команды агентов.
Сложнее с координацией. В симуляциях разработки старые модели создавали конфликтующие pull request, которые часто не доходили до merge. Более новые модели избегали конфликтов частично за счёт изоляции по файлам. По словам Anthropic, только самая новая из протестированных моделей сочетала совместную работу над кодом с высокой долей принятых изменений.
Главный риск — одинаковость поведения. Агенты с похожим контекстом и обвязкой могут одновременно принять одно и то же неудачное решение: от одинаковых имён веток до повторяющихся творческих ответов. Вывод Anthropic простой: при запуске групп агентов нужно следить не только за качеством каждого агента, но и за поведением всей системы.
Источники
- Anthropicanthropic.com