中文

GenSync:基于 3D 高斯溅出的音频驱动多主体 lip-sync 框架

计算机视觉与模式识别 2025-05-06 v1

摘要

我们提出了 GenSync,一种用于多身份 lip-sync 视频合成的新框架,基于 3D 高斯溅出(3D Gaussian Splatting)。不同于大多数需要为每个身份训练新模型的 3D 方法,GenSync 学习一个统一的网络,可为多个说话人合成 lip-sync 视频。通过纳入 Disentanglement Module(Disentanglement Module 保留),我们的方法将 identity-specific features(identity-specific features 保留)从 audio representations(audio representations 保留)中分离,实现了高效的多身份视频合成。该设计降低了计算开销,实现了比现有最先进模型 6.8 倍的训练速度,同时保持了高水平的 lip-sync 准确性和视觉质量。

关键词

引用

@article{arxiv.2505.01928,
  title  = {GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting},
  author = {Anushka Agarwal and Muhammad Yusuf Hassan and Talha Chafekar},
  journal= {arXiv preprint arXiv:2505.01928},
  year   = {2025}
}