Google DeepMind представила модель SL2T (Sign Language to Text), способную переводить жестовый язык непосредственно в текст. Технология призвана упростить общение людей, использующих жестовые языки, с цифровыми сервисами, сообщает El.kz.
В отличие от обычных систем распознавания речи, которые преобразуют аудио в текст, SL2T работает с жестами. Жестовые языки имеют собственную грамматику, а их передача включает сложные движения рук и тела в трёхмерном пространстве.
Для распознавания система не использует перчатки или обработку необработанного видеопотока. Вместо этого SL2T отслеживает координаты ключевых точек тела с помощью MediaPipe Holistic. Полученные пространственные данные затем преобразуются моделью в текст.
Такая технология позволяет пользователю совершать привычные жесты перед камерой и получать их текстовую интерпретацию. В перспективе это может пригодиться для поиска информации, написания сообщений и общения в режиме реального времени без необходимости каждый раз переходить к клавиатуре.
Разработка Google DeepMind показывает, как ИИ может адаптироваться не только к устной речи, но и к другим формам человеческого общения. При этом жестовые языки отличаются друг от друга, поэтому для полноценной работы подобных систем необходимо учитывать особенности конкретных языков и их грамматики.
Ранее мы писали о полезных и необычных гаджетах для книголюбов.