VividFace:面向视频人脸增强的高质量高效单步扩散模型
计算机视觉与模式识别
2025-11-21 v2
摘要
视频人脸增强(VFE)旨在从退化视频序列中恢复高质量的人脸区域,支持广泛的实际应用。尽管该领域取得了显著进展,当前主要依赖视频超分辨率和生成式框架的方法仍面临三个根本挑战:(1) 扩散模型迭代多步去噪导致的计算效率低下;(2) 在保持时间一致性的同时忠实建模复杂人脸纹理;(3) 由于缺乏高质量人脸视频训练数据的模型泛化能力有限。为此,我们提出了 VividFace,一个用于 VFE 的新型高效单步扩散框架。基于预训练的 WANX 视频生成模型,VividFace 将传统的多步扩散过程重新构想为单步流匹配范式,直接将退化输入映射到高质量输出,显著缩短推理时间。为增强人脸细节恢复,我们引入了联合潜像-像素人脸聚焦训练策略,通过构建时空对齐的人脸掩码引导优化指向关键人脸区域的潜空间和像素空间。此外,我们开发了由 MLLM驱动的自动化筛选管道,生成 MLLM-Face90 数据集,确保模型从真实感人脸纹理中学习。大量实验表明,VividFace 在感知质量、身份保持和时间一致性方面在合成和真实世界基准测试中均实现卓越表现。我们将公开代码、模型和数据集以支持未来研究。
引用
@article{arxiv.2509.23584,
title = {VividFace: High-Quality and Efficient One-Step Diffusion For Video Face Enhancement},
author = {Shulian Zhang and Yong Guo and Long Peng and Ziyang Wang and Ye Chen and Wenbo Li and Xiao Zhang and Yulun Zhang and Jian Chen},
journal= {arXiv preprint arXiv:2509.23584},
year = {2025}
}