UniSync:面向挑战场景的通用高保真唇部同步方法
计算机视觉与模式识别
2026-03-05 v1
摘要
唇部同步旨在生成与给定音频匹配的逼真说话视频,这是高质量视频配音的关键。然而,当前方法存在根本性缺陷:基于掩码的方法 suffer from local color discrepancies,而无掩码方法在全局背景纹理错位方面困难。此外,大多数方法在处理多样化的真实场景时仍有挑战,如风格化化身、面部遮挡和极端光照条件。本文提出 UniSync,一个统一框架,旨在实现 diverse scenarios 下的高保真唇部同步。具体而言,UniSync 使用基于姿态锚定的无掩码训练策略,以保持头部动作并消除合成色彩瑕疵;同时采用基于掩码的一致推理,以确保结构精确和平滑混合。值得注意的是,针对紧凑但多样化视频的微调赋予模型 exceptional domain adaptability,有效处理复杂 corner case。我们还引入 RealWorld-LipSync benchmark 以评估模型在真实世界需求下的表现,涵盖包括人类面部和风格化化身在内的多种应用场景。广泛实验表明,UniSync 在显著优于 state-of-the-art 方法,推动领域向 truly generalizable 和 production-ready 唇部同步迈进。
引用
@article{arxiv.2603.03882,
title = {UniSync: Towards Generalizable and High-Fidelity Lip Synchronization for Challenging Scenarios},
author = {Ruidi Fan and Yang Zhou and Siyuan Wang and Tian Yu and Yutong Jiang and Xusheng Liu},
journal= {arXiv preprint arXiv:2603.03882},
year = {2026}
}
备注
9 pages, 5 figures