中文

基于 STMC-Transformer 的更优手语翻译

计算与语言 2020-11-04 v2 计算机视觉与模式识别 人机交互 机器学习

摘要

手语翻译(SLT)首先使用手语识别(SLR)系统从视频中提取手语词素(glosses),然后由翻译系统根据手语词素生成口语翻译。本文关注翻译系统,并引入 STMC-Transformer,其在 PHOENIX-Weather 2014T 数据集的词素到文本和视频到文本翻译上分别比当前最优(state-of-the-art)提升超过 5 和 7 个 BLEU。在 ASLG-PC12 语料上,我们报告了超过 16 个 BLEU 的提升。我们还揭示了当前依赖词素监督的方法所存在的问题:我们的 STMC-Transformer 的视频到文本翻译优于真实词素(GT glosses)的翻译。这与先前认为 GT 词素翻译可作为 SLT 性能上限的说法相矛盾,并表明词素是手语的一种低效表示。因此,对于未来的 SLT 研究,我们建议对识别和翻译模型进行端到端训练,或采用不同的手语标注方案。

关键词

引用

@article{arxiv.2004.00588,
  title  = {Better Sign Language Translation with STMC-Transformer},
  author = {Kayo Yin and Jesse Read},
  journal= {arXiv preprint arXiv:2004.00588},
  year   = {2020}
}

备注

Proceedings of the 28th International Conference on Computational Linguistics (COLING'2020)