中文

DicFace:基于Dirichlet约束的变分码本学习用于时序一致的视频人脸恢复

计算机视觉与模式识别 2025-06-17 v1

摘要

视频人脸恢复面临在从退化输入中恢复细节的同时维持时序一致性的关键挑战。本文提出一种新方法,将预训练于静态高质量肖像的向量量化变分自编码器(VQ-VAEs)扩展为视频恢复框架,通过变分潜在空间建模实现。我们的关键创新在于将离散码本表示重新表述为Dirichlet分布的连续变量,使其能够在不同帧之间实现概率性过渡。采用空间-时间Transformer架构联合建模帧间依赖关系并预测潜在分布,同时结合Laplacian约束的重建损失与感知(LPIPS)正则化,增强像素精度和视觉质量。针对盲人脸恢复、视频inpainting和人脸色彩化等任务进行了全面评估,展示了超越现有方法的卓越性能。这一工作建立了有效的范式,用于将预训练于高质量图像的强大图像先验知识适应到视频恢复中,同时解决了关键的闪烁效应问题。源代码已开源,地址为https://github.com/fudan-generative-vision/DicFace。

关键词

引用

@article{arxiv.2506.13355,
  title  = {DicFace: Dirichlet-Constrained Variational Codebook Learning for Temporally Coherent Video Face Restoration},
  author = {Yan Chen and Hanlin Shang and Ce Liu and Yuxuan Chen and Hui Li and Weihao Yuan and Hao Zhu and Zilong Dong and Siyu Zhu},
  journal= {arXiv preprint arXiv:2506.13355},
  year   = {2025}
}