EMoG:基于扩散模型合成富有情感的语音协同3D手势
计算机视觉与模式识别
2023-06-21 v1
摘要
尽管以前的语音协同手势生成方法能够合成与语音内容一致的动作,但仍然不足以处理多样且复杂的动作分布。关键挑战在于:1)语音内容与手势之间的一对多性质;2)身体关节之间的相关性建模。在本文中,我们提出了一个新颖的框架(EMoG),利用去噪扩散模型来解决上述挑战:1)为了缓解一对多问题,我们引入情感线索来指导生成过程,使生成变得更容易;2)为了对关节相关性进行建模,我们提出将困难的手势生成分解为两个子问题:关节相关性建模和时间动态建模。然后,通过我们提出的关节相关性感知 Transformer(JCFormer)明确解决这两个子问题。通过广泛的评估,我们证明我们提出的方法超越了以前的最先进方法,在手势合成方面具有实质性的优越性。
引用
@article{arxiv.2306.11496,
title = {EMoG: Synthesizing Emotive Co-speech 3D Gesture with Diffusion Model},
author = {Lianying Yin and Yijun Wang and Tianyu He and Jinming Liu and Wei Zhao and Bohan Li and Xin Jin and Jianxin Lin},
journal= {arXiv preprint arXiv:2306.11496},
year = {2023}
}
备注
under review