MMTalker:基于多分辨率与多模态特征融合的三维说话头像合成
计算机视觉与模式识别
2026-04-06 v1
摘要
语音驱动的三维面部动画合成旨在建立从一维(1D)语音信号到时变 3D 面部运动信号的映射。当前方法在保持唇同步精度和生成逼真面部表情方面仍面临挑战,主要源于这一跨模态映射的高度不适定性。在本文中,我们提出了一种新颖的三维音频驱动面部动画合成方法,通过多分辨率表示和多模态特征融合,称为 MMTalker,能够准确重建丰富的 3D 面部运动细节。我们首先通过网格参数化和非均匀可微采样实现具有细节的 3D 面部连续表示。网格参数化技术建立了 UV 平面与 3D 面部网格之间的对应关系,用于为连续学习提供真值。可微非均匀采样通过为每个三角面设置可学习采样概率,实现对面部细节的精确获取。接下来,我们采用残差图卷积网络和双重交叉注意力机制从多个输入模态中提取判别性面部运动特征。所提出的多模态融合策略充分利用了语音的层次特征以及面部网格的显式时空几何特征。最后,一个轻量回归网络通过联合处理规范 UV 空间中的采样点和编码的面部运动特征,预测合成说话面部的逐顶点几何位移。综合实验表明,在唇和眼运动的同步精度方面,相较于最先进方法取得了显著提升。
引用
@article{arxiv.2604.02941,
title = {MMTalker: Multiresolution 3D Talking Head Synthesis with Multimodal Feature Fusion},
author = {Bin Liu and Zhixiang Xiong and Zhifen He and Bo Li},
journal= {arXiv preprint arXiv:2604.02941},
year = {2026}
}
备注
9 pages