Исследователи нашли уязвимость в скрытых reasoning-трассах AI API
В новой работе говорится, что зашифрованные блоки рассуждений OpenAI, Anthropic и Google можно было переиспользовать между сессиями и декодировать через более слабые совместимые модели; основные атаки уже закрыты.
Исследователи описали архитектурную уязвимость в зашифрованных reasoning-объектах, которые используют API OpenAI, Anthropic и Google. Такие непрозрачные блоки нужны, чтобы сохранять скрытые рассуждения модели между вызовами API, когда историю диалога управляет клиент. По данным работы, эти блоки оказались переносимыми между сессиями, пользователями и совместимыми моделями внутри экосистемы одного провайдера.
Из-за этого возникала практическая утечка. Исследователи утверждают, что более слабую совместимую модель можно было заставить декодировать reasoning-блок, созданный более сильной моделью, и вывести скрытую chain-of-thought. В публичных траекториях AI-агентов они декодировали 315 320 reasoning-блоков и нашли сотни приватных артефактов из реальных пользовательских сессий: API-ключи, пароли, access-токены и приватные ключи.
Масштаб риска ограничен: злоумышленнику нужен сам зашифрованный reasoning-блок, например из опубликованного сырого лога агента, а работа не заявляет о произвольном доступе к приватным чатам или эксплуатации в реальном мире. Авторы также пишут, что после исправлений провайдеров основная атака больше не воспроизводится.
Практический вывод для разработчиков простой: не публиковать и не коммитить сырые API-транскрипты с reasoning-объектами. Очистка только видимого текста может оставить секреты внутри скрытых полей.
Источники
- arXivarxiv.org
- The Hacker Newsthehackernews.com