中文

EMoG:基于扩散模型合成富有情感的语音协同3D手势

计算机视觉与模式识别 2023-06-21 v1

摘要

尽管以前的语音协同手势生成方法能够合成与语音内容一致的动作,但仍然不足以处理多样且复杂的动作分布。关键挑战在于:1)语音内容与手势之间的一对多性质;2)身体关节之间的相关性建模。在本文中,我们提出了一个新颖的框架(EMoG),利用去噪扩散模型来解决上述挑战:1)为了缓解一对多问题,我们引入情感线索来指导生成过程,使生成变得更容易;2)为了对关节相关性进行建模,我们提出将困难的手势生成分解为两个子问题:关节相关性建模和时间动态建模。然后,通过我们提出的关节相关性感知 Transformer(JCFormer)明确解决这两个子问题。通过广泛的评估,我们证明我们提出的方法超越了以前的最先进方法,在手势合成方面具有实质性的优越性。

关键词

引用

@article{arxiv.2306.11496,
  title  = {EMoG: Synthesizing Emotive Co-speech 3D Gesture with Diffusion Model},
  author = {Lianying Yin and Yijun Wang and Tianyu He and Jinming Liu and Wei Zhao and Bohan Li and Xin Jin and Jianxin Lin},
  journal= {arXiv preprint arXiv:2306.11496},
  year   = {2023}
}

备注

under review