混合信号:基于运动基元混合的手语生成
计算机视觉与模式识别
2021-07-27 v2
摘要
在语音级别表示口语是常见的做法。然而,对于手语,这意味着将运动分解为其组成的运动基元。基于虚拟人的手语生成 (SLP) 传统上正是这样做的,通过手部运动、形状和面部表情的序列构建动画。然而,最近基于深度学习的 SLP 解决方案使用估计完整骨架结构的单一网络来处理该问题。我们建议将 SLP 任务分为两个不同的联合训练子任务。第一个翻译子任务在 gloss 监督下将口语翻译为潜在的手语表示。随后,动画子任务旨在生成与学习到的时空表示紧密相似的富有表现力的手语序列。在翻译子任务中使用渐进式 Transformer,我们提出了一种用于手语动画的新型运动基元混合 架构。在训练期间学习一组不同的运动基元,这些基元可以在推断时进行时间组合以生成连续的手语序列。我们在具有挑战性的 RWTH-PHOENIX-Weather-2014T(PHOENIX14T) 数据集上进行评估,进行了广泛的消融研究,并表明 MoMP 在用户评估中优于基线。我们实现了 SOTA 的反向翻译性能,比竞争结果提高了 11%。重要的是,我们首次展示了从口语到手语的完整翻译流水线比从 gloss 到手语具有更强的性能。
引用
@article{arxiv.2107.11317,
title = {Mixed SIGNals: Sign Language Production via a Mixture of Motion Primitives},
author = {Ben Saunders and Necati Cihan Camgoz and Richard Bowden},
journal= {arXiv preprint arXiv:2107.11317},
year = {2021}
}