基于运动变形的身份保持视频配音
计算机视觉与模式识别
2025-01-10 v2
摘要
视频配音旨在从参考视频和驱动音频信号合成逼真的、同步嘴型的视频。尽管现有方法能够准确生成由音频驱动的嘴型,但往往难以保留身份特征,主要原因是未能有效捕捉音频线索与参考身份视觉属性之间细微的相互作用。因此,生成的输出经常缺乏对参考身份独特纹理和结构细节的再现。为解决这些限制,我们提出了 IPTalker—a 一个新型且稳健的视频配音框架,实现了驱动音频与参考身份之间的无缝对齐,同时确保嘴同步准确性和高保真身份保持。在 IPTalker 的核心是基于 Transformer 的对齐机制,旨在动态捕捉和建模音频特征与参考图像之间的对应关系,从而实现精确的、身份感知的音视频集成。基于此对齐机制,运动变形策略进一步通过对参考图像进行空间变形以匹配目标音频驱动配置来细化结果。随后,专门的精炼过程用于缓解遮挡伪影并增强细粒度纹理的保留,如嘴部细节和皮肤特征。广泛的定性和定量评估表明,IPTalker 在逼真度、嘴同步和身份保留方面 consistently 优于现有方法,为高质量、身份一致的视频配音树立了新的技术标准。
关键词
引用
@article{arxiv.2501.04586,
title = {Identity-Preserving Video Dubbing Using Motion Warping},
author = {Runzhen Liu and Qinjie Lin and Yunfei Liu and Lijian Lin and Ye Zhu and Yu Li and Chuhua Xian and Fa-Ting Hong},
journal= {arXiv preprint arXiv:2501.04586},
year = {2025}
}
备注
v2, Under Review