基于3D虚拟形象的语音到手语翻译的简单基线
计算机视觉与模式识别
2024-07-04 v2
摘要
本文的目标是开发一个将口语翻译成手语的功能性系统,称为Spoken2Sign翻译。Spoken2Sign任务与传统的从手语到口语(Sign2Spoken)的翻译任务正交且互补。为了实现Spoken2Sign翻译,我们提出了一个包含三个步骤的简单基线:1)利用现有的Sign2Spoken基准创建注释-视频词典;2)为词典中的每个手语视频估计一个3D手语动作;3)借助生成的注释-3D手语词典,训练一个Spoken2Sign模型,该模型由Text2Gloss翻译器、手语连接器和渲染模块组成。翻译结果随后通过手语虚拟形象显示。据我们所知,我们是首个以3D手语输出格式呈现Spoken2Sign任务的团队。除了其Spoken2Sign翻译能力外,我们还展示了我们方法的两个副产品——3D关键点增强和多视角理解——能够辅助基于关键点的手语理解。代码和模型可在https://github.com/FangyunWei/SLRT获取。
引用
@article{arxiv.2401.04730,
title = {A Simple Baseline for Spoken Language to Sign Language Translation with 3D Avatars},
author = {Ronglai Zuo and Fangyun Wei and Zenggui Chen and Brian Mak and Jiaolong Yang and Xin Tong},
journal= {arXiv preprint arXiv:2401.04730},
year = {2024}
}
备注
Accepted by ECCV 2024