toolcall.
Регулирование12 авг. 2026 г., 14:29 UTC

Исследователи нашли уязвимость в скрытых reasoning-трассах AI API

В новой работе говорится, что зашифрованные блоки рассуждений OpenAI, Anthropic и Google можно было переиспользовать между сессиями и декодировать через более слабые совместимые модели; основные атаки уже закрыты.

Исследователи описали архитектурную уязвимость в зашифрованных reasoning-объектах, которые используют API OpenAI, Anthropic и Google. Такие непрозрачные блоки нужны, чтобы сохранять скрытые рассуждения модели между вызовами API, когда историю диалога управляет клиент. По данным работы, эти блоки оказались переносимыми между сессиями, пользователями и совместимыми моделями внутри экосистемы одного провайдера.

Из-за этого возникала практическая утечка. Исследователи утверждают, что более слабую совместимую модель можно было заставить декодировать reasoning-блок, созданный более сильной моделью, и вывести скрытую chain-of-thought. В публичных траекториях AI-агентов они декодировали 315 320 reasoning-блоков и нашли сотни приватных артефактов из реальных пользовательских сессий: API-ключи, пароли, access-токены и приватные ключи.

Масштаб риска ограничен: злоумышленнику нужен сам зашифрованный reasoning-блок, например из опубликованного сырого лога агента, а работа не заявляет о произвольном доступе к приватным чатам или эксплуатации в реальном мире. Авторы также пишут, что после исправлений провайдеров основная атака больше не воспроизводится.

Практический вывод для разработчиков простой: не публиковать и не коммитить сырые API-транскрипты с reasoning-объектами. Очистка только видимого текста может оставить секреты внутри скрытых полей.

Источники

Упоминаются

ai-securityapi-securityreasoning-models