一种用于细节丰富且时序一致的视频超分辨率的一步扩散方法
计算机视觉与模式识别
2025-10-23 v3 人工智能
摘要
在现实视频超分辨率(Real-VSR)中,同时保持丰富的空间细节和时序一致性是一个具有挑战性的问题,尤其是当我们利用如稳定扩散(stable diffusion, SD)等预训练生成模型进行真实细节合成时。现有的基于SD的Real-VSR方法往往在空间细节与时序连贯性之间进行权衡,导致视觉质量不佳。我们认为,关键在于如何有效地从低质量(LQ)输入视频中提取具有鲁健性的时序一致性先验,并在保持这些先验的同时增强视频细节。为此,我们提出了一种双LoRA学习(DLoRAL)范式,用于训练有效的基于SD的一步扩散模型,实现细节丰富且时序一致的输出。具体而言,我们引入了跨帧检索(CFR)模块以聚合跨帧的互补信息,并训练一致性LoRA(C-LoRA)从退化输入中学习鲁健的时序表示。完成一致性学习后,我们固定CFR和C-LoRA模块,训练细节LoRA(D-LoRA)以在保持与C-LoRA定义的时序空间一致性的前提下增强空间细节。两个阶段交替迭代进行优化,协同Deliver出一致且细节丰富的输出。在推理阶段,两个LoRA分支被合并到SD模型中,实现单步扩散的高效高质量视频恢复。实验表明,DLoRAL在准确性和速度方面均表现出色。代码和模型已提供,访问链接为https://github.com/yjsunnn/DLoRAL。
引用
@article{arxiv.2506.15591,
title = {One-Step Diffusion for Detail-Rich and Temporally Consistent Video Super-Resolution},
author = {Yujing Sun and Lingchen Sun and Shuaizheng Liu and Rongyuan Wu and Zhengqiang Zhang and Lei Zhang},
journal= {arXiv preprint arXiv:2506.15591},
year = {2025}
}
备注
Accepted by Neurips2025