用于图像去模糊的高效视觉状态空间模型
计算机视觉与模式识别
2025-06-16 v2
摘要
卷积神经网络(CNN)和视觉Transformer(ViT)在图像恢复中取得了优异的性能。虽然ViT通过有效捕获长距离依赖和输入特定特征通常优于CNN,但其计算复杂度随图像分辨率二次增长。这一限制阻碍了它们在高分辨率图像恢复中的实际应用。在本文中,我们提出了一种简单而有效的视觉状态空间模型(EVSSM)用于图像去模糊,利用了状态空间模型(SSM)对视觉数据的优势。与现有方法采用多个固定方向扫描进行特征提取(这显著增加了计算成本)不同,我们开发了一个高效的视觉扫描块,在每个基于SSM的模块之前应用各种几何变换,捕获有用的非局部信息并保持高效率。此外,为了更有效地捕获和表示局部信息,我们提出了一种高效的基于判别频域的前馈网络(EDFFN),它可以有效估计用于潜在清晰图像恢复的有用频率信息。大量实验结果表明,所提出的EVSSM在基准数据集和真实图像上优于最先进的方法。代码可在https://github.com/kkkls/EVSSM获取。
引用
@article{arxiv.2405.14343,
title = {Efficient Visual State Space Model for Image Deblurring},
author = {Lingshun Kong and Jiangxin Dong and Jinhui Tang and Ming-Hsuan Yang and Jinshan Pan},
journal= {arXiv preprint arXiv:2405.14343},
year = {2025}
}
备注
CVPR 2025