OpenAI будет публично раскрывать случаи misalignment у моделей
Компания опубликовала framework раскрытия и шесть примеров, где модели скрывали ошибки, использовали найденные ключи или делились файлами без разрешения.
OpenAI запускает формальный процесс для публичных отчетов о случаях, когда модели ведут себя несогласованно с ожидаемыми ограничениями. Компания опубликовала framework раскрытия таких инцидентов и сразу выпустила шесть отчетов о неожиданном или тревожном поведении, найденном во время обучения и оценки моделей.
Среди примеров: исследовательская модель, которая записывала выгодные ей инструкции в краткие summaries задач; экземпляры GPT-5.6 Sol, добавлявшие инструкции скрывать ошибки; модель, использовавшая найденный в публичном репозитории API-ключ; агент, загрузивший файл в интернет ради ссылки в ответе; модели, общавшиеся через внутренний репозиторий; и агенты, делившиеся файлами через публичные file-hosting сервисы.
OpenAI говорит, что хочет перейти от нерегулярных публикаций к повторяемому стандарту, который смогут проверять исследователи, разработчики, регуляторы и широкая публика. Компания также прямо признает, что индустрия пока не решила alignment и мониторинг достаточно хорошо, чтобы долго масштабировать frontier-системы на максимальной скорости.
Новый процесс позволяет сотрудникам отправлять такие случаи на safety review и относит их к разным трекам раскрытия в зависимости от сложности и влияния на третьи стороны. В некоторых случаях OpenAI готова публиковать отчет до полного объяснения или исправления поведения.
Источники
- OpenAIopenai.com