中文

Splat-Portrait:利用 Gaussian Splatting 泛化说话人脸

计算机视觉与模式识别 2026-01-27 v1

摘要

说话人脸生成旨在从语音和单张人像图像合成外观自然的说话视频。以往的 3D 说话人脸生成方法依赖于特定领域的启发式方法(如基于形变的面部运动表示先验)来驱动说话动作,但仍然产生不准确的 3D 虚拟人重建,从而破坏了生成动画的真实感。我们引入了 Splat-Portrait,一种基于 Gaussian Splatting 的方法,解决了 3D 人脸重建和嘴唇运动合成的挑战。我们的方法自动学习将单张人像图像解耦为表示为静态 Gaussian Splatting 的静态 3D 重建和预测的全图 2D 背景。然后,它在输入音频的条件下生成自然的嘴唇运动,而无需任何运动驱动先验。训练完全由 2D 重建和分数蒸馏损失驱动,无需 3D 监督或特征点。实验结果表明,Splat-Portrait 在说话人脸生成和新视角合成方面表现出卓越的性能,与以往工作相比实现了更好的视觉质量。我们的项目代码和补充文档已在 https://github.com/stonewalking/Splat-portrait 公开。

关键词

引用

@article{arxiv.2601.18633,
  title  = {Splat-Portrait: Generalizing Talking Heads with Gaussian Splatting},
  author = {Tong Shi and Melonie de Almeida and Daniela Ivanova and Nicolas Pugeault and Paul Henderson},
  journal= {arXiv preprint arXiv:2601.18633},
  year   = {2026}
}