中文

MuseTalk:基于时空抽样的实时高保真视频配音

计算机视觉与模式识别 2025-03-27 v3

摘要

保持身份一致性同时实现准确唇部同步的实时视频配音仍是关键挑战。现有方法面临三难:扩散方法实现高视觉保真度但计算成本高昂,GAN方法则为实现实时性能牺牲唇部同步精度或牙龈细节。我们提出MuseTalk,一种通过潜空间优化和时空数据抽样策略解决这一矛盾的双阶段训练框架。我们的关键创新包括:(1)在面部抽象预训练阶段,我们提出信息帧抽样以实现参考源姿态对的时间对齐,消除冗余特征干扰同时保留身份线索。(2)在唇部同步对抗微调阶段,我们采用动态边缘抽样以空间选择最合适的唇动引导区域,平衡音视频同步与牙龈清晰度。(3)MuseTalk在潜空间建立有效的音视频特征融合框架,在NVIDIA V100 GPU上实现256×256分辨率下的30 FPS输出。广泛实验表明,MuseTalk在视觉保真度上优于最先进的方法,同时实现可比的唇部同步精度。%代码和模型将在接受后公开。代码已公开于 https://github.com/TMElyralab/MuseTalk

关键词

引用

@article{arxiv.2410.10122,
  title  = {MuseTalk: Real-Time High-Fidelity Video Dubbing via Spatio-Temporal Sampling},
  author = {Yue Zhang and Zhizhou Zhong and Minhao Liu and Zhaokang Chen and Bin Wu and Yubin Zeng and Chao Zhan and Yingjie He and Junxin Huang and Wenjiang Zhou},
  journal= {arXiv preprint arXiv:2410.10122},
  year   = {2025}
}

备注

15 pages, 4 figures