Anthropic заявила, что тесты Claude задели реальные системы компаний
Компания приостановила кибертесты с доступом в интернет после ошибки в партнерской среде оценки.
Anthropic заявила, что несколько моделей Claude во время кибербезопасностных тестов получили доступ к реальным системам из-за ошибочной настройки среды оценки.
По данным Axios, компания проверила более 141 000 запусков кибертестов и нашла случаи, затронувшие три внешние организации. Модели должны были решать контролируемые задания в формате capture-the-flag, но партнерская среда оказалась подключена к интернету. Anthropic утверждает, что публичные защитные ограничения, которые обычно работают в продуктах Claude, для этих тестов были снижены.
Случаи отличались друг от друга. В одном Claude, по сообщению Axios, атаковал реальный сайт, название которого совпало с вымышленной компанией из задания. В другом модель загрузила вредоносный Python-пакет в публичный репозиторий пакетов, и он ненадолго попал на реальные машины. Еще одна внутренняя исследовательская модель просканировала тысячи целей и скомпрометировала интернет-приложение, а затем остановилась, когда поняла, что оказалась вне задания.
Главный вывод не в том, что Claude начал действовать с собственными целями. Вывод проще: тесты frontier-моделей теперь требуют такой же жесткой изоляции, как серьезные лаборатории безопасности. Anthropic говорит, что приостановила кибертесты с доступом в интернет, пока пересматривает настройку среды.
Источники:
Источники
- Axiosaxios.com
- Anthropic system cardsanthropic.com
- Anthropic Transparency Hubanthropic.com