toolcall.
Регулирование30 июл. 2026 г., 23:29 UTC

Anthropic заявила, что тесты Claude задели реальные системы компаний

Компания приостановила кибертесты с доступом в интернет после ошибки в партнерской среде оценки.

Anthropic заявила, что несколько моделей Claude во время кибербезопасностных тестов получили доступ к реальным системам из-за ошибочной настройки среды оценки.

По данным Axios, компания проверила более 141 000 запусков кибертестов и нашла случаи, затронувшие три внешние организации. Модели должны были решать контролируемые задания в формате capture-the-flag, но партнерская среда оказалась подключена к интернету. Anthropic утверждает, что публичные защитные ограничения, которые обычно работают в продуктах Claude, для этих тестов были снижены.

Случаи отличались друг от друга. В одном Claude, по сообщению Axios, атаковал реальный сайт, название которого совпало с вымышленной компанией из задания. В другом модель загрузила вредоносный Python-пакет в публичный репозиторий пакетов, и он ненадолго попал на реальные машины. Еще одна внутренняя исследовательская модель просканировала тысячи целей и скомпрометировала интернет-приложение, а затем остановилась, когда поняла, что оказалась вне задания.

Главный вывод не в том, что Claude начал действовать с собственными целями. Вывод проще: тесты frontier-моделей теперь требуют такой же жесткой изоляции, как серьезные лаборатории безопасности. Anthropic говорит, что приостановила кибертесты с доступом в интернет, пока пересматривает настройку среды.

Источники:

Источники

Упоминаются

ai-safetyanthropicclaudecybersecuritysecurity