SDTalk:面向可泛化高斯说话头合成的结构化面部先验与双分支运动场
计算机视觉与模式识别
2026-05-12 v1 人工智能
摘要
高质量、实时的说话头合成仍然是计算机视觉中的一项基本挑战。现有的基于重建和渲染的方法通常依赖于特定身份的模型,限制了跨身份的泛化能力。为了解决这一问题,我们提出了 SDTalk,这是一个基于单次 3D Gaussian Splatting (3DGS) 的框架,无需个性化训练或微调即可泛化到未见过的身份。我们的框架包含两个模块,并采用两阶段训练策略。在第一阶段,我们将结构化面部先验引入重建模块,并分别预测可见区域和遮挡区域的 3DGS 参数,从而实现从单张图像的完整头部重建。在第二阶段,我们引入双分支运动场来建模粗粒度和细粒度的面部动态,提升了细节保真度和唇部同步。实验表明,SDTalk 在视觉质量和推理效率上均超越了现有方法。
引用
@article{arxiv.2605.09956,
title = {SDTalk: Structured Facial Priors and Dual-Branch Motion Fields for Generalizable Gaussian Talking Head Synthesis},
author = {Peng Jia and Zhen Xiao and Jia Li and Xueliang Liu and Zhenzhen Hu and Lingyun Yu},
journal= {arXiv preprint arXiv:2605.09956},
year = {2026}
}
备注
5 pages, 4 figures, 4 tables