中文

D^3-Talker:用于少样本三维说话人头部合成的双分支解耦形变场

计算机视觉与模式识别 2025-08-21 v1

摘要

三维说话人头部合成的一个关键挑战在于,需要为每个目标身份从头开始训练一个新模型,这依赖于长时间的视频。近期方法试图通过预训练模型从音频中提取通用特征来解决此问题。然而,由于音频包含与唇部运动无关的信息,当仅在少数帧上训练时,现有方法通常难以将给定的音频映射到目标面部上真实的唇部行为,导致唇音同步性差和说话人头部图像质量不佳。本文提出了 D^3-Talker,这是一种新方法,它构建了一个静态三维高斯属性场,并采用音频和面部运动信号来独立控制两个不同的高斯属性形变场,从而有效地解耦了通用形变和个性化形变的预测。我们在预训练期间设计了一种新颖的相似性对比损失函数,以实现更彻底的解耦。此外,我们集成了一个由粗到精的模块来细化渲染图像,减轻由头部运动引起的模糊并增强整体图像质量。大量实验表明,D^3-Talker 在有限训练数据下,无论是在高保真渲染还是精确的音唇同步方面,都优于最先进的方法。我们的代码将在接收后提供。

关键词

引用

@article{arxiv.2508.14449,
  title  = {D^3-Talker: Dual-Branch Decoupled Deformation Fields for Few-Shot 3D Talking Head Synthesis},
  author = {Yuhang Guo and Kaijun Deng and Siyang Song and Jindong Xie and Wenhui Ma and Linlin Shen},
  journal= {arXiv preprint arXiv:2508.14449},
  year   = {2025}
}