MAGIC-Talk:基于可定制身份控制的运动感知音频驱动说话人脸生成
计算机视觉与模式识别
2025-10-28 v1
摘要
音频驱动说话人脸生成近年来因数字媒体和虚拟形象应用而受到广泛关注。虽然近期方法改进了音频-唇形同步,但往往在时序一致性、身份保持和定制方面存在挑战,尤其在长视频生成中更为突出。为此,我们提出了 MAGIC-Talk,一个基于单次扩散的可定制且时序稳定的说话人脸生成框架。MAGIC-Talk 包含 ReferenceNet,用于保持身份并通过文本提示实现精细面部编辑;以及 AnimateNet,通过结构运动先验增强运动连贯性。不同于需要多个参考图像或微调的先前方法,MAGIC-Talk 仅需单张图像即可保持身份,并确保帧与帧之间的平滑过渡。此外,本文引入了渐进式潜在融合策略,以减少运动不一致和闪烁,提高长视频质量。大量实验表明,MAGIC-Talk 在视觉质量、身份保持和同步精度方面均优于最先进的方法,为说话人脸生成提供了稳健的解决方案。
引用
@article{arxiv.2510.22810,
title = {MAGIC-Talk: Motion-aware Audio-Driven Talking Face Generation with Customizable Identity Control},
author = {Fatemeh Nazarieh and Zhenhua Feng and Diptesh Kanojia and Muhammad Awais and Josef Kittler},
journal= {arXiv preprint arXiv:2510.22810},
year = {2025}
}