Подразделение Google DeepMind рассказало о намерении донести революцию в области искусственного интеллекта до 70 млн человек по всему миру, которые общаются на языках жестов. Новая модель SL2T преобразует эти языки в текст.

Лучший процессор под DDR4 в 2026 году: AM4 против LGA 1700

Сравнительный тест камер флагманских смартфонов (2026): итоги

Снято в Голливуде? Почему Стэнли Кубрик физически не смог бы подделать лунную походку

Выбираем лучшие игровые ноутбуки на российском рынке (вторая половина 2026 года)

Топ-10 смартфонов до 10 тысяч рублей (2026 год)

Обзор беззеркальной камеры Sony Alpha 7 V: эволюция с человеческим лицом

Компьютер месяца — август 2026 года

Google SL2T — многоязычная модель-переводчик, которая дебютирует на смартфонах Pixel 11, позволяя преобразовывать язык жестов в текст через приложения Gboard и Live Transcribe. На начальном этапе её применение ограничивается американским языком жестов и его переводом на английский. Способность ИИ обрабатывать человеческую речь за последние годы значительно продвинулась — сейчас можно просто диктовать текст на смартфон, планшет или ПК. Но до настоящего момента это не относилось к тем, кто пользуется одним из более чем 200 существующих языков жестов.
Модель SL2T позволяет людям, испытывающим проблемы со слухом, взаимодействовать со смартфоном, используя привычный язык и не вводя текст вручную. В этом формате теперь можно отправлять поисковые запросы, составлять электронные письма и сообщения для мессенджеров, редактировать документы и выполнять другие задачи, в том числе отправлять запросы и инструкции для ИИ-помощника Gemini. Модель доступна в Google Live Transcribe, то есть перевод с языка жестов можно осуществлять в реальном времени во время видеозвонков.
Google обучила SL2T на более чем 100 тыс. часов с данными 50 жестовых языков, и четверть из этого набора относится к американскому. Первоначальный вариант поддерживает только американский, но Google проводила обучение и на примерах других, чтобы модель могла изучить общие закономерности. Чтобы развеять опасения по поводу конфиденциальности, в Google уточнили, что в SL2T используется встроенная модель компьютерного зрения MediaPipe Holistic, которая отслеживает геометрию положений лица, рук, туловища и тела человека — на облачный сервер отправляются для расшифровки только их координаты, а не видеозапись.
Модель производит преобразование непосредственно в текст, минуя промежуточные текстовые аннотации. Это позволяет SL2T эффективнее интерпретировать невербальные выражения и пространственные грамматические структуры, характерные для американского языка жестов. Google также приняла меры для сокращения задержки, предотвращения галлюцинаций, предусмотрела поддержку левшей и правшей, а также пользователей, которые «говорят» только одной рукой — чтобы второй можно было держать смартфон. Важным отличием SL2T от предыдущих моделей того же назначения является её способность следить не только за руками, но также за движением головы, лица и туловища, которые также помогают передавать смысл. В перспективе Google намерена охватить другие языки жестов, а также разработать модели для генерации напрямую на этих языках.



Добавить комментарий