Google DeepMind тестирует double-blind проверки Gemini
Пилотный подход скрывает и benchmark-промпты, и веса модели, чтобы внешние safety-тесты было сложнее заранее подстроить.
Google DeepMind сообщила, что провела пилотную double-blind проверку закрытой модели Gemini Flash Lite в защищённой среде, где скрыты и benchmark-промпты, и веса модели.
Проект сделан вместе с Singapore AI Safety Institute, OpenMined, AVERI и MLCommons. В такой схеме внешние тестовые задания находятся внутри криптографически защищённой среды, а сама модель также не раскрывается провайдеру бенчмарка и аудитору. Главная цель — снизить benchmark contamination: риск, что модель уже видела вопросы теста во время обучения или подготовки к оценке.
MLCommons пишет, что для пилота использовалась закрытая часть safety-бенчмарка AILuminate, с которой модели Google DeepMind раньше не сталкивались. AVERI запускала промпты через secure computation OpenMined на контейнеризованной модели Google DeepMind, получая сигналы о надёжности без раскрытия тестового набора разработчику и весов модели оценщикам.
Это пока proof of concept, а не новый публичный результат Gemini. Но новость важна: AI-лаборатории, регуляторы и компании всё больше опираются на внешние оценки безопасности и возможностей моделей. Если double-blind проверки станет проще проводить, результаты бенчмарков будет сложнее искусственно завысить и проще использовать для реальных решений о внедрении.
Источники
- Google DeepMinddeepmind.google
- MLCommonsmlcommons.org