单目通用高斯说话人头动画
计算机视觉与模式识别
2025-04-02 v1
摘要
本 work 提出一种单目通用高斯说话人头动画(MGGTalk),其要求单目数据集,并可推广到未见身份无需个人化再训练。与需要难以获取的多视角数据或繁琐个人化学习/推理的先前 3D 高斯溅写(3DGS)方法相比,MGGtalk 实现了更实用和更广泛的应用。然而,由于缺乏多视角和个人化训练数据,几何和外观信息的不完整性构成了显著挑战。为解决这些挑战,MGGTalk 利用深度信息来增强几何和面部对称性特征,以补充几何和外观特征。初始基于从深度估计获得的像素级几何信息,我们采用对称操作和点云滤波技术,确保 3DGS 的位置参数完整且精确。随后,我们采用具有对称先验的两阶段策略来预测剩余 3DGS 参数。我们首先预测源图像可见面部区域的高斯参数,然后利用这些参数来提高预测不可见区域高斯参数的准确性。广泛实验表明,MGGTalk 超过了前沿方法,在各种指标上实现了卓越的性能。
引用
@article{arxiv.2504.00665,
title = {Monocular and Generalizable Gaussian Talking Head Animation},
author = {Shengjie Gong and Haojie Li and Jiapeng Tang and Dongming Hu and Shuangping Huang and Hao Chen and Tianshui Chen and Zhuoman Liu},
journal= {arXiv preprint arXiv:2504.00665},
year = {2025}
}
备注
Accepted by CVPR 2025