中文

EmbedTalk:基于嵌入驱动的无三棱说话头合成

计算机视觉与模式识别 2026-03-10 v1

摘要

实时说话头合成日益依赖于可变形的 3D 高斯溶解(3DGS),因为其低延迟。三棱(tri-planes)是对高斯在变形前编码的标准选择,因为它们提供了具有显式空间关系的连续域。然而,三棱表示受限于网格分辨率和由将 3D 体积场投影到 2D 子空间引入的近似误差。最近的工作表明,学习型嵌入在 4D 场景重建中驱动时间变形方面具有优势。我们提出 EmbedTalk\textbf{EmbedTalk},展示了如何利用此类嵌入来建模说话头的语音变形。通过全面实验,我们表明 EmbedTalk 在渲染质量、唇同步和运动一致性方面优于现有的 3DGS-based 方法,同时与最新生成模型保持竞争力。此外,用学习型嵌入取代三棱编码可实现显著更紧凑的模型,在移动 GPU(RTX 2060 6 GB)上实现 60+ FPS。我们的代码将在接受后公开。

关键词

引用

@article{arxiv.2603.07604,
  title  = {EmbedTalk: Triplane-Free Talking Head Synthesis using Embedding-Driven Gaussian Deformation},
  author = {Arpita Saggar and Jonathan C. Darling and Duygu Sarikaya and David C. Hogg},
  journal= {arXiv preprint arXiv:2603.07604},
  year   = {2026}
}

备注

Preprint