中文

单目通用高斯说话人头动画

计算机视觉与模式识别 2025-04-02 v1

摘要

本 work 提出一种单目通用高斯说话人头动画(MGGTalk),其要求单目数据集,并可推广到未见身份无需个人化再训练。与需要难以获取的多视角数据或繁琐个人化学习/推理的先前 3D 高斯溅写(3DGS)方法相比,MGGtalk 实现了更实用和更广泛的应用。然而,由于缺乏多视角和个人化训练数据,几何和外观信息的不完整性构成了显著挑战。为解决这些挑战,MGGTalk 利用深度信息来增强几何和面部对称性特征,以补充几何和外观特征。初始基于从深度估计获得的像素级几何信息,我们采用对称操作和点云滤波技术,确保 3DGS 的位置参数完整且精确。随后,我们采用具有对称先验的两阶段策略来预测剩余 3DGS 参数。我们首先预测源图像可见面部区域的高斯参数,然后利用这些参数来提高预测不可见区域高斯参数的准确性。广泛实验表明,MGGTalk 超过了前沿方法,在各种指标上实现了卓越的性能。

关键词

引用

@article{arxiv.2504.00665,
  title  = {Monocular and Generalizable Gaussian Talking Head Animation},
  author = {Shengjie Gong and Haojie Li and Jiapeng Tang and Dongming Hu and Shuangping Huang and Hao Chen and Tianshui Chen and Zhuoman Liu},
  journal= {arXiv preprint arXiv:2504.00665},
  year   = {2025}
}

备注

Accepted by CVPR 2025