toolcall.
Модели7 окт. 2026 г., 08:25 UTC

Google выпускает EmbeddingGemma 2 для приватного мультимодального поиска

Открытая модель на 740 млн параметров переводит текст, код, изображения, аудио и видео в единое embedding-пространство для локального поиска и RAG.

Google DeepMind выпустила EmbeddingGemma 2, открытую мультимодальную embedding-модель для локального поиска и retrieval-приложений. Модель построена на архитектуре Gemma 4, распространяется под лицензией Apache 2.0 и имеет 740 млн параметров.

Главное изменение в том, что EmbeddingGemma теперь не ограничивается текстом. По словам Google, новая модель переводит текст, код, изображения, аудио и видео в единое embedding-пространство, поэтому разработчики могут искать по смешанным медиа через одну модель. Среди примеров — поиск нужного фрагмента видео по голосовой заметке или поиск по аудиозаписям через текстовый запрос.

Google делает акцент на privacy-first RAG и on-device сценариях. Модель можно запускать модульно: примерно от 270 млн параметров для text-only режима до полной мультимодальной конфигурации. Также она поддерживает более короткие векторы через Matryoshka Representation Learning, чтобы снижать размер локальных vector database. По данным Google, quantized text-only веса могут использовать около 191MB active RAM, а полная мультимодальная модель — около 567MB на Pixel 11 Pro.

Для разработчиков это важно потому, что embeddings — базовый слой для поиска, памяти и retrieval. Сильная открытая модель, которая работает локально, упрощает приватные сценарии для документов, медиа и ассистентов.

Источники

Упоминаются

google-deepmindmodel-launchmultimodal-aiopen-modelsprivacy