面向多通道手语生成的对抗训练
计算机视觉与模式识别
2020-08-31 v1
摘要
手语是丰富的多通道语言,需要以精确而复杂的方式表达手动(手)和非手动(面部与身体)特征。手语生成(SLP)是从口语到手语的自动翻译,必须体现这种完整的手语形态才能被聋人社区真正理解。先前的工作主要关注手动特征生成,因回归到均值而导致表达不充分。本文中,我们提出一种对抗式多通道 SLP 方法。我们将手语生成构建为基于 transformer 的生成器与条件判别器之间的极小极大博弈。我们的对抗判别器依据源文本评估手语生成的真实感,推动生成器朝向真实且清晰的表达。此外,我们通过纳入非手动特征完整封装手语发音器官,生成面部特征与口型模式。我们在具挑战性的 RWTH-PHOENIX-Weather-2014T (PHOENIX14T) 数据集上评估,并报告了手动生成的最先进 SLP 回译性能。我们为多通道手语生成设立了新基准,以支撑未来对真实 SLP 的研究。
关键词
引用
@article{arxiv.2008.12405,
title = {Adversarial Training for Multi-Channel Sign Language Production},
author = {Ben Saunders and Necati Cihan Camgoz and Richard Bowden},
journal= {arXiv preprint arXiv:2008.12405},
year = {2020}
}