DiffPoseTalk:基于扩散模型的语音驱动风格化 3D 面部动画与头部姿态生成
计算机视觉与模式识别
2024-05-15 v2 图形学
摘要
生成由语音驱动的风格化 3D 面部动画是一项重大挑战,因为它需要学习语音、风格与相应自然面部运动之间的多对多映射。然而,现有方法要么采用确定性的语音到运动映射模型,要么使用独热编码方案编码风格。值得注意的是,独热编码方法无法捕捉风格的复杂性,从而限制了泛化能力。本文中,我们提出 DiffPoseTalk,一种基于扩散模型并结合风格编码器的生成框架,该编码器从短参考视频中提取风格嵌入。推理过程中,我们采用无分类器引导,基于语音与风格引导生成过程。特别地,我们的风格包含头部姿态的生成,从而增强用户感知。此外,我们通过在高质野外音视频数据集上重建的 3DMM 参数训练模型,解决了扫描 3D 说话人脸数据短缺的问题。大量实验与用户研究表明我们的方法优于最先进方法。代码与数据集见 https://diffposetalk.github.io。
引用
@article{arxiv.2310.00434,
title = {DiffPoseTalk: Speech-Driven Stylistic 3D Facial Animation and Head Pose Generation via Diffusion Models},
author = {Zhiyao Sun and Tian Lv and Sheng Ye and Matthieu Lin and Jenny Sheng and Yu-Hui Wen and Minjing Yu and Yong-Jin Liu},
journal= {arXiv preprint arXiv:2310.00434},
year = {2024}
}
备注
SIGGRAPH 2024 (Journal Track). Project page: https://diffposetalk.github.io/