Google DeepMind добавляет sign-language AI в Pixel
Новая модель SL2T включает ASL-to-English диктовку в Gboard и Live Transcribe на Pixel 11; позже появятся другие устройства и жестовые языки.
Google DeepMind представила SL2T, масштабную многоязычную модель sign-language-to-text, которая выходит в потребительские продукты. Первый запуск включает ASL-to-English диктовку в Gboard и Live Transcribe на Pixel 11: пользователь может жестами вводить текст там, где обычно печатал бы руками, включая поиск, сообщения, документы и запросы к Gemini.
Модель обучена на более чем 100 000 часов данных по более чем 50 жестовым языкам, примерно четверть данных приходится на ASL. Google DeepMind подчеркивает, что жестовые языки требуют полноценного перевода, а не пословной транскрипции: у них своя грамматика, а смысл передается одновременными движениями рук, корпуса, головы, лица и мимикой.
Для приватности SL2T не переводит сырой видеопоток напрямую. On-device модель MediaPipe превращает изображение человека в pose landmarks, а серверная модель переводит эти геометрические координаты в текст. Google обещает добавить больше устройств и жестовых языков позже.
Запуск важен потому, что accessibility AI часто остается на уровне демо. Здесь есть понятный путь в реальный продукт для глухих и слабослышащих пользователей, а обработка жестовых языков получает массовую consumer-поверхность, а не только исследовательский benchmark.
Источники
- Google DeepMinddeepmind.google