通过手语反向翻译利用单语数据改进手语翻译
计算机视觉与模式识别
2021-05-27 v1 计算与语言
摘要
尽管手语翻译(SLT)已有开创性工作,仍存在一显著障碍,即平行手语-文本数据数量有限。为应对这一平行数据瓶颈,我们提出手语反向翻译(SignBT)方法,将海量口语文本引入 SLT 训练。借助文本到 gloss 的翻译模型,我们首先将单语文本反向翻译为其 gloss 序列。随后,通过在特征层级从估计的 gloss-to-sign 库中拼接片段生成配对的符号序列。最后,合成平行数据作为编码器-解码器 SLT 框架端到端训练的强力补充。为推动 SLT 研究,我们进一步贡献 CSL-Daily,一个大规模连续手语翻译数据集。它同时提供口语翻译与 gloss 级标注。主题围绕人们的日常生活(如出行、购物、医疗),也是最可能的 SLT 应用场景。我们在 CSL-Daily 上报告了 SLT 方法的广泛实验结果与分析。借助所提出的手语反向翻译方法,我们相较先前最先进的 SLT 方法取得了实质性提升。
引用
@article{arxiv.2105.12397,
title = {Improving Sign Language Translation with Monolingual Data by Sign Back-Translation},
author = {Hao Zhou and Wengang Zhou and Weizhen Qi and Junfu Pu and Houqiang Li},
journal= {arXiv preprint arXiv:2105.12397},
year = {2021}
}
备注
To appear in 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2021)