中文

基于关键点且无需注释的手语翻译

计算机视觉与模式识别 2022-06-15 v2

摘要

手语翻译(SLT)相较于手语识别(SLR)的研究相对较少。然而,SLR 是一种识别手语独特语法(不同于口语且存在非残障人士难以理解的问题)的研究。因此,我们致力于解决将手语视频直接翻译为口语的问题。为此,我们提出一种新的关键点归一化方法,用于基于手语者的骨架点进行翻译,并对手语翻译中的这些点进行鲁棒归一化。该定制化按身体部位进行的归一化方法有助于性能提升。此外,我们提出一种随机帧选择方法,可同时实现帧增强与采样。最后,通过基于注意力的翻译模型将其翻译为口语。我们的方法可应用于多种数据集,且能以适用于无注释数据集的方式应用。此外,定量实验评估证明了我们方法的优越性。

关键词

引用

@article{arxiv.2204.10511,
  title  = {Keypoint based Sign Language Translation without Glosses},
  author = {Youngmin Kim and Minji Kwak and Dain Lee and Yeongeun Kim and Hyeongboo Baek},
  journal= {arXiv preprint arXiv:2204.10511},
  year   = {2022}
}

备注

14 pages, 5 figures