中文

HighSync:基于潜在扩散模型的高质量唇部同步技术

计算机视觉与模式识别 2026-05-19 v1

摘要

我们提出了 HighSync,一个基于扩散模型的端到端框架,用于高保真唇部同步,能够生成与任意输入音频相匹配的逼真说话人面部视频。现有方法普遍困难在同时实现图像质量与同步精度,产生要么视觉受损的输出,要么在时间上不一致的唇部动作。HighSync 同时解决了这两个挑战,并且在我们看来,这是第一个原生在 512*512 分辨率上运行的唇部同步模型,使其成为面向专业制作环境(如电影和广播行业)的可行解决方案。我们方法的核心在于识别并系统性地消除一种数据泄漏现象,这种现象在先前工作中悄然削弱了时间建模,阻止模型发展出对音频信号的真正依赖。针对感知质量和同步精度等多个指标进行了全面评估,确认 HighSync 在两个方面均实现了最先进的性能。源代码、预训练模型以及补充视频结果已公开于 https://github.com/saeed5959/high_sync

关键词

引用

@article{arxiv.2605.16918,
  title  = {HighSync: High-Quality Lip Synchronization via Latent Diffusion Models},
  author = {Saeed Firouzi Daghigh and Majid Iranpour Mobarekeh and Mostafa Alavi and Mehdi Bagheri},
  journal= {arXiv preprint arXiv:2605.16918},
  year   = {2026}
}

备注

12 pages, 7 figures, 5 tables