无遮罩音频驱动说话人脸生成:提升视觉质量与身份保持
计算机视觉与模式识别
2025-07-29 v1
摘要
音频驱动说话人脸生成旨在生成逼真的说话人脸视频,聚焦于准确的音频-唇部同步,同时不损害与身份相关的视觉细节。最近的领先方法基于图像填充,即遮罩输入人脸下半部分,由模型填充被遮罩区域,使唇部与给定音频对齐。因此,为保留下半部分的身份相关视觉细节,这些方法还需要从同一视频中随机选择一张未遮罩的身份参考图像。然而,这种常见的遮罩策略存在以下问题:(1) 输入人脸信息损失,显著影响网络保留视觉质量和身份细节的能力;(2) 身份参考图像与输入图像之间的差异导致重建性能下降;(3) 身份参考图像对模型产生负面影响,导致复制与音频无关的元素。为解决这些问题,我们提出一种无遮罩的说话人脸生成方法,同时保持2D基于人脸编辑任务。我们不对下半部分遮罩,而是通过两种分阶段基于 landmarks 的方法(以无配对方式训练)将输入图像转换为张口的面部图像。随后,我们将这些经过编辑但未遮罩的人脸图像与音频一起提供给唇部适应模型,以生成适当的唇部动作。因此,我们的方法既不需要未遮罩的输入图像,也不需要身份参考图像。我们在基准数据集LRS2和HDTF上进行实验,并进行了各种消融研究,以验证我们的贡献。
引用
@article{arxiv.2507.20953,
title = {Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation},
author = {Dogucan Yaman and Fevziye Irem Eyiokur and Leonard Bärmann and Hazım Kemal Ekenel and Alexander Waibel},
journal= {arXiv preprint arXiv:2507.20953},
year = {2025}
}