中文

从视频中学习语音驱动的3D对话手势

计算机视觉与模式识别 2021-02-16 v1

摘要

我们提出了第一种从语音输入自动且联合合成虚拟角色的同步3D对话身体与手部手势,以及3D面部与头部动画的方法。我们的算法采用CNN架构,利用面部表情与手部手势之间的固有相关性。对话身体手势的合成是一个多模态问题,因为许多相似的手势都可以合理地伴随相同的输入语音。为在此设定下合成合理的身体手势,我们训练了一个基于生成对抗网络(GAN)的模型,用于衡量所生成的3D身体运动序列与输入音频特征配对时的合理性。我们还贡献了一种新方法,可从说话人的野外视频中创建超过33小时标注身体、手部和面部数据的大型语料库。为此,我们将最先进的单目3D身体与手部姿态估计以及稠密3D面部性能捕捉方法应用于该视频语料库。通过这种方式,我们能够以比以往依赖复杂 studio 内动作捕捉方案的算法多几个数量级的数据进行训练,从而训练出更具表现力的合成算法。我们的实验与用户研究表明,我们的语音合成全3D角色动画具有最先进的品质。

关键词

引用

@article{arxiv.2102.06837,
  title  = {Learning Speech-driven 3D Conversational Gestures from Video},
  author = {Ikhsanul Habibie and Weipeng Xu and Dushyant Mehta and Lingjie Liu and Hans-Peter Seidel and Gerard Pons-Moll and Mohamed Elgharib and Christian Theobalt},
  journal= {arXiv preprint arXiv:2102.06837},
  year   = {2021}
}