手语 Transformer:联合端到端手语识别与翻译
计算机视觉与模式识别
2020-04-02 v1 计算与语言
人机交互
机器学习
摘要
先前关于手语翻译的工作表明,拥有中层手语 gloss 表示(有效地识别出单个手语手势)能大幅提升翻译性能。事实上,当前翻译领域的 SOTA 需要 gloss 级别的分词才能工作。我们引入了一种基于 Transformer 的新颖架构,该架构能够联合学习连续手语识别与翻译,并且可以进行端到端训练。这是通过使用连接时序分类(CTC)损失将识别和翻译问题绑定在单一统一架构中来实现的。这种联合方法不需要任何真实时间信息,同时解决了两个相互依存的序列到序列学习问题,并带来了显著的性能提升。我们在具有挑战性的 RWTH-PHOENIX-Weather-2014T (PHOENIX14T) 数据集上评估了我们方法的识别和翻译性能。我们报告了由我们的 Sign Language Transformers 实现的 SOTA 手语识别和翻译结果。我们的翻译网络优于手语视频到口语语言以及 gloss 到口语语言的翻译模型,在某些情况下性能提升了一倍以上(9.58 vs. 21.80 BLEU-4 Score)。我们还分享了在其他几个文本到文本手语翻译任务中使用 Transformer 网络的新基线翻译结果。
引用
@article{arxiv.2003.13830,
title = {Sign Language Transformers: Joint End-to-end Sign Language Recognition and Translation},
author = {Necati Cihan Camgoz and Oscar Koller and Simon Hadfield and Richard Bowden},
journal= {arXiv preprint arXiv:2003.13830},
year = {2020}
}