基于 Mamba 的鲁棒视频超分辨率框架 VSRM
计算机视觉与模式识别
2025-10-07 v3
摘要
视频超分辨率是低层视觉任务中的重要挑战之一. 迄今为止,基于 CNN 和 Transformer 的方法取得了令人瞩目的成果. 然而,CNN 受限于局部感受野,而 Transformer 面临二次复杂度,给处理 VSR 中的长序列提出了挑战. 最近,Mamba 因其长序列建模、线性复杂度和大感受野而受到关注. 本文提出 VSRM,一个新型视频超分辨率框架,利用 Mamba 的强大功能. VSRM 引入空间到时间 Mamba 和时间到空间 Mamba 块,有效提取长程时空特征并增强感受野. 为更好地对齐相邻帧,我们提出了可变形 Cross-Mamba 对齐模块. 该模块利用可变形 cross-mamba 机制使补偿阶段更具动态和灵活性,防止特征失真. 最后,我们通过提出简单而有效的频率 Charbonnier-like loss 来最小化重建帧与真实帧之间的频率域差距,更好地保留高频内容并提升视觉质量. 通过大量实验,VSRM 在多样化基准测试上实现了最先进的结果,为未来研究奠定了坚实基础.
引用
@article{arxiv.2506.22762,
title = {VSRM: A Robust Mamba-Based Framework for Video Super-Resolution},
author = {Dinh Phu Tran and Dao Duy Hung and Daeyoung Kim},
journal= {arXiv preprint arXiv:2506.22762},
year = {2025}
}
备注
Arxiv version of ICCV 2025 paper (3rd version)