中文

SDTalk:面向可泛化高斯说话头合成的结构化面部先验与双分支运动场

计算机视觉与模式识别 2026-05-12 v1 人工智能

摘要

高质量、实时的说话头合成仍然是计算机视觉中的一项基本挑战。现有的基于重建和渲染的方法通常依赖于特定身份的模型,限制了跨身份的泛化能力。为了解决这一问题,我们提出了 SDTalk,这是一个基于单次 3D Gaussian Splatting (3DGS) 的框架,无需个性化训练或微调即可泛化到未见过的身份。我们的框架包含两个模块,并采用两阶段训练策略。在第一阶段,我们将结构化面部先验引入重建模块,并分别预测可见区域和遮挡区域的 3DGS 参数,从而实现从单张图像的完整头部重建。在第二阶段,我们引入双分支运动场来建模粗粒度和细粒度的面部动态,提升了细节保真度和唇部同步。实验表明,SDTalk 在视觉质量和推理效率上均超越了现有方法。

关键词

引用

@article{arxiv.2605.09956,
  title  = {SDTalk: Structured Facial Priors and Dual-Branch Motion Fields for Generalizable Gaussian Talking Head Synthesis},
  author = {Peng Jia and Zhen Xiao and Jia Li and Xueliang Liu and Zhenzhen Hu and Lingyun Yu},
  journal= {arXiv preprint arXiv:2605.09956},
  year   = {2026}
}

备注

5 pages, 4 figures, 4 tables