IMTalker:基于隐式运动传递的高效音频驱动说话人脸生成
计算机视觉与模式识别
2025-12-01 v1 人工智能
摘要
说话人脸生成旨在从单张图像合成逼真的说话人脸,但现有方法常依赖显式光流和局部变形,难以建模复杂的全局运动,导致身份漂移。我们提出IMTalker,一种通过隐式运动传递实现高效且高保真度说话人脸生成的新框架。核心思想是用交叉注意力机制取代传统的基于流的变形,隐式地在统一的潜在空间中建模运动差异和身份对齐,从而实现稳健的全局运动渲染。为了进一步在跨身份再现中保留说话者身份,我们引入一个身份自适应模块,将运动潜在向量投影到个人化空间,确保运动与身份之间的清晰解耦。此外,一个轻量级的流匹配运动生成器从音频、姿态和注视线索中产生生动且可控的隐式运动向量。广泛的实验表明,IMTalker在运动精度、身份保持和音频-嘴唇同步方面均优于先前方法,实现了以卓越效率为峰值的时尚质量,在RTX 4090 GPU上实现视频驱动的40 FPS和音频驱动的42 FPS。我们将发布代码和预训练模型以促进应用和未来研究。
引用
@article{arxiv.2511.22167,
title = {IMTalker: Efficient Audio-driven Talking Face Generation with Implicit Motion Transfer},
author = {Bo Chen and Tao Liu and Qi Chen and Xie Chen and Zilong Zheng},
journal= {arXiv preprint arXiv:2511.22167},
year = {2025}
}
备注
11 pages, 5 figures