中文

KeySync:一种鲁棒的高分辨率无泄漏唇形同步方法

计算机视觉与模式识别 2025-05-02 v1

摘要

唇形同步,即将现有视频中的唇部动作与新的输入音频对齐的任务,通常被视为音频驱动面部动画的一个简化变体。然而,除了面临说话人脸生成中的常见问题(例如时间一致性)外,唇形同步还带来了重大的新挑战,如来自输入视频的表情泄漏和面部遮挡,这些挑战会严重影响自动配音等现实应用,但在现有工作中常被忽视。为了解决这些不足,我们提出了 KeySync,这是一个两阶段框架,成功解决了时间一致性问题,同时通过精心设计的掩码策略融入了对泄漏和遮挡的解决方案。我们表明,KeySync 在唇部重建和交叉同步方面取得了 SOTA 结果,根据我们提出的全新泄漏指标 LipLeak,提高了视觉质量并减少了表情泄漏。此外,我们展示了新掩码方法在处理遮挡方面的有效性,并通过几项消融实验验证了我们的架构选择。代码和模型权重可在 https://antonibigata.github.io/KeySync 获取。

关键词

引用

@article{arxiv.2505.00497,
  title  = {KeySync: A Robust Approach for Leakage-free Lip Synchronization in High Resolution},
  author = {Antoni Bigata and Rodrigo Mira and Stella Bounareli and Michał Stypułkowski and Konstantinos Vougioukas and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:2505.00497},
  year   = {2025}
}