DF-3DFace:基于扩散模型的一对多语音同步三维人脸动画
计算机视觉与模式识别
2023-10-11 v1 人工智能
多媒体
图像与视频处理
摘要
语音驱动的三维人脸动画因能基于语音在三维空间中生成逼真且富有表现力的人脸动画而备受关注。基于学习的方法在实现与语音精确同步的面部运动方面已展现出可喜进展。然而,语音到三维人脸合成的一对多特性尚未被充分探索:尽管嘴唇与语音内容精确同步,超出语音相关运动的其他面部属性相对于语音是可变的。为考虑单一语音内面部属性的潜在差异,我们提出DF-3DFace,一种扩散驱动的语音到三维人脸网格合成方法。DF-3DFace基于扩散捕获语音与三维人脸间复杂的一对多关系。它通过利用音频—网格同步与掩码条件化同时实现对齐的唇部运动。此外,所提方法除面部运动外还联合建模身份与姿态,从而无需参考身份网格即可生成三维人脸动画并产生自然的头部姿态。我们贡献了一个新的大规模三维人脸网格数据集3D-HDTF,以实现三维人脸网格在身份、姿态与面部运动上的变化合成。大量实验表明,我们的方法能成功从语音生成高度可变的面部形状与运动,同时比现有最优(SOTA)方法实现更逼真的人脸动画。
引用
@article{arxiv.2310.05934,
title = {DF-3DFace: One-to-Many Speech Synchronized 3D Face Animation with Diffusion},
author = {Se Jin Park and Joanna Hong and Minsu Kim and Yong Man Ro},
journal= {arXiv preprint arXiv:2310.05934},
year = {2023}
}