PMMTalk:基于互补伪多模态特征的语音驱动3D面部动画
计算机视觉与模式识别
2023-12-06 v1 人工智能
摘要
语音驱动的3D面部动画近年来有了很大改进,但大多数相关工作仅利用声学模态,忽略了视觉和文本线索的影响,导致在精度和连贯性方面结果不理想。我们认为视觉和文本线索并非琐碎信息。因此,我们提出了一个新颖框架,即PMMTalk,利用互补的伪多模态特征来提高面部动画的准确性。该框架包含三个模块:PMMTalk编码器、跨模态对齐模块和PMMTalk解码器。具体来说,PMMTalk编码器利用现成的说话头生成架构和语音识别技术分别从语音中提取视觉和文本信息。随后,跨模态对齐模块在时间和语义层面上对齐音频-图像-文本特征。然后使用PMMTalk解码器预测唇形同步的面部混合形状系数。与先前方法相反,PMMTalk仅需要一张额外的随机参考人脸图像,但能产生更准确的结果。此外,它通过引入面部混合形状系数,无缝集成到标准动画制作流程中,因此对艺术家友好。最后,鉴于3D说话人脸数据集的稀缺性,我们引入了一个大规模3D中文视听面部动画数据集(3D-CAVFA)。大量实验和用户研究表明,我们的方法优于现有技术水平。建议观看补充视频。
引用
@article{arxiv.2312.02781,
title = {PMMTalk: Speech-Driven 3D Facial Animation from Complementary Pseudo Multi-modal Features},
author = {Tianshun Han and Shengnan Gui and Yiqing Huang and Baihui Li and Lijian Liu and Benjia Zhou and Ning Jiang and Quan Lu and Ruicong Zhi and Yanyan Liang and Du Zhang and Jun Wan},
journal= {arXiv preprint arXiv:2312.02781},
year = {2023}
}