RealisVSR:面向真实世界 4K 视频超分辨率的细节增强扩散模型
图像与视频处理
2025-07-28 v1 计算机视觉与模式识别
摘要
视频超分辨率(VSR)通过扩散模型取得了显著进展,有效缓解了基于 GAN 的方法所固有的过度平滑问题。尽管近年来取得了诸多进展,VSR 领域仍存在三个关键挑战:1) 基础模型中对时间动态的建模不一致;2) 在复杂真实世界退化条件下高频细节恢复能力有限;3) 对细节增强和 4K 超分辨率的评估不足,因为现有方法主要依赖缺乏细节的 720P 数据集。为应对上述挑战,我们提出了 RealisVSR,一种高频细节增强的视频扩散模型,包含三项核心创新:1) 一致性保持 ControlNet(CPC)架构,与 Wan2.1 视频扩散模型相结合,用于建模平滑与复杂的运动并抑制伪影;2) 高频整流扩散损失(HR-Loss),结合小波分解与 HOG 特征约束以实现纹理恢复;3) RealisVideo-4K,首个包含 1,000 对高清视频-文本对的公开 4K VSR 基准数据集。借助 Wan2.1 先进的时空引导能力,我们的方法仅需现有方法 5%–25% 的训练数据量。在 VSR 基准数据集(REDS、SPMCS、UDM10、YouTube-HQ、VideoLQ、RealisVideo-720P)上的大量实验表明,我们的方法具有显著优势,尤其在超高分辨率场景下表现突出。
引用
@article{arxiv.2507.19138,
title = {RealisVSR: Detail-enhanced Diffusion for Real-World 4K Video Super-Resolution},
author = {Weisong Zhao and Jingkai Zhou and Xiangyu Zhu and Weihua Chen and Xiao-Yu Zhang and Zhen Lei and Fan Wang},
journal= {arXiv preprint arXiv:2507.19138},
year = {2025}
}