中文

强调显著姿态的语义一致性用于语音驱动手势生成

计算机视觉与模式识别 2024-10-18 v1

摘要

语音驱动手势生成旨在合成与输入语音信号同步的手势序列。以往方法利用神经网络直接将紧凑的音频表示映射到手势序列,忽略了不同模态之间的语义关联,无法处理显著手势。本文提出一种强调显著姿态语义一致性的语音驱动手势生成方法。具体而言,我们首先学习音频和身体姿态的个体表示的联合流形空间,以利用两种模态之间固有的语义关联,提出通过一致性损失来强制语义一致性。进一步,我们通过引入弱监督检测器识别显著姿态,并对一致性损失进行重新加权,以更关注显著姿态与语音内容高层次语义之间的对应关系。在此基础上,我们提出分别提取面部表情和身体手势的音频特征,并设计分别的分支来合成面部和身体手势。广泛的实验结果表明,我们的方法在语义一致性和手势生成质量方面优于当前最先进的方法。

关键词

引用

@article{arxiv.2410.13786,
  title  = {Emphasizing Semantic Consistency of Salient Posture for Speech-Driven Gesture Generation},
  author = {Fengqi Liu and Hexiang Wang and Jingyu Gong and Ran Yi and Qianyu Zhou and Xuequan Lu and Jiangbo Lu and Lizhuang Ma},
  journal= {arXiv preprint arXiv:2410.13786},
  year   = {2024}
}