DiffVSR:揭示驯服复杂退化情境下鲁棒视频超分辨率的有效配方
计算机视觉与模式识别
2025-03-11 v3
摘要
扩散模型在图像修复中展现出卓越的能力, 但其应用于视频超分辨率(VSR)面临在保真度与时序一致性之间的平衡挑战。我们的评估揭示了一个关键缺口:现有方法在面对严重退化的视频时始终难以胜任——正是这些情况下, 扩散模型的生成能力最为必要。我们识别出现有基于扩散的VSR方法主要 struggles 由于面临巨大的学习负担:同时建模复杂的退化分布、内容表征和时序关系, 而高质量训练数据有限。为解决这一根本性挑战, 我们提出DiffVSR, 包含渐进式学习策略(PLS), 通过分阶段训练系统性地分解这一学习负担, 实现在复杂退化情境下的卓越性能。该框架额外采用交错潜在过渡(ILT)技术, 无需额外训练开销即可保持竞争的时序一致性。实验表明, 我们的 approach 在竞争方法挣扎的场景中大显身手, 尤其在严重退化的视频上。我们的工作揭示了关注学习策略而非仅聚焦于架构复杂度, 是通往鲁棒现实视频超分辨率的关键路径。
引用
@article{arxiv.2501.10110,
title = {DiffVSR: Revealing an Effective Recipe for Taming Robust Video Super-Resolution Against Complex Degradations},
author = {Xiaohui Li and Yihao Liu and Shuo Cao and Ziyan Chen and Shaobin Zhuang and Xiangyu Chen and Yinan He and Yi Wang and Yu Qiao},
journal= {arXiv preprint arXiv:2501.10110},
year = {2025}
}
备注
Project page: https://xh9998.github.io/DiffVSR-project/