消除平均化:基于身份适配器的无平均化唇同步角色
计算机视觉与模式识别
2025-09-03 v2
摘要
最近的基于扩散模型的唇同步生成模型在生成高度同步的说话面部视频方面取得了显著进展。尽管这些模型在唇部同步方面表现出色,但往往难以控制生成图像中面部细节。在本工作中,我们识别了“唇平均化”现象,即在对不可见的野生视频进行配音时,模型未能保留面部细微细节。这种问题是由于常用的 UNet 主干网络主要通过跨注意力机制和多尺度融合将音频特征集成到潜在空间的视觉表示中,但难以在生成的面部中保留精细的唇部细节。为解决此问题,我们提出了 UnAvgLip,通过从参考视频中提取身份嵌入来生成高度忠实的面部序列,同时保持准确的唇部同步。具体而言,我们的方法包含两个主要组件:(1) 一个身份感知模块,用于编码面部嵌入以与条件音频特征对齐;(2) 一个 ID-CrossAttn 模块,将面部嵌入注入生成过程,以增强模型在身份保持方面的能力。大量实验表明,在 modest 的训练和推理成本下,UnAvgLip 有效缓解了唇填充中的“平均化”现象,显著保留了独特的面部特征,同时保持精确的唇部同步。与原始方法相比,我们的方法在两个基准数据集(HDTF 和 LRW)上分别在身份一致性指标上提升了 5%,在 SSIM 指标上提升了 2%。
引用
@article{arxiv.2503.06397,
title = {Removing Averaging: Personalized Lip-Sync Driven Characters Based on Identity Adapter},
author = {Yanyu Zhu and Lichen Bai and Jintao Xu and Hai-tao Zheng},
journal= {arXiv preprint arXiv:2503.06397},
year = {2025}
}