中文

Audio2Gestures:从音频生成多样化手势

计算机视觉与模式识别 2023-01-18 v1

摘要

人们在说相同句子时,可能受各种心理和生理因素影响而做出多样化手势。这种固有的一对多关系使得从音频生成共语手势(co-speech gesture)尤为困难。常规CNNs/RNNs假设一对一映射,因此倾向于预测所有可能目标运动的平均值,在推理时容易产出平淡/乏味的运动。因此我们提出通过将对跨模态潜在编码拆分为共享编码和运动特定编码,来显式建模一对多音频到运动映射。共享编码预期负责与音频更相关的运动分量,而运动特定编码预期捕捉更独立于音频的多样化运动信息。然而,将潜在编码拆分为两部分带来了额外的训练困难。我们设计了若干关键训练损失/策略,包括松弛运动损失、 bicycle约束和多样性损失,以更好地训练VAE。在3D和2D运动数据集上的实验从定量和定性上验证了我们的方法比先前最先进方法生成更真实且多样的运动。此外,我们的公式兼容离散余弦变换(discrete cosine transformation, DCT)建模和其他流行骨干网络(即RNN、Transformer)。关于运动损失和定量运动评估,我们发现考虑时间和/或空间上下文的结构化损失/指标(如STFT)补充了最常用的逐点损失(如PCK),带来更好的运动动态和更精细的运动细节。最后,我们展示了我们的方法可轻易用于生成时间线上带用户指定运动片段的运动序列。

关键词

引用

@article{arxiv.2301.06690,
  title  = {Audio2Gestures: Generating Diverse Gestures from Audio},
  author = {Jing Li and Di Kang and Wenjie Pei and Xuefei Zhe and Ying Zhang and Linchao Bao and Zhenyu He},
  journal= {arXiv preprint arXiv:2301.06690},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2108.06720