VmambaIR:用于图像复原的视觉状态空间模型
计算机视觉与模式识别
2024-03-19 v1
摘要
图像复原是低级计算机视觉中的一项关键任务,旨在从退化输入中恢复高质量图像。各种模型,如卷积神经网络(CNN)、生成对抗网络(GAN)、Transformer 和扩散模型(DM),已被用于解决这一问题并产生了显著影响。然而,CNN 在捕获长程依赖方面存在局限性。DM 需要大型先验模型和计算密集的去噪步骤。Transformer 具有强大的建模能力,但由于其复杂度随输入图像大小呈二次增长而面临挑战。为了应对这些挑战,我们提出了 VmambaIR,将具有线性复杂度的状态空间模型(SSM)引入综合图像复原任务中。我们利用 Unet 架构来堆叠我们提出的全向选择性扫描(OSS)模块,该模块由一个 OSS 模块和一个高效前馈网络(EFFN)组成。我们提出的全向选择性扫描机制通过在所有六个方向上高效建模图像信息流,克服了 SSM 的单向建模限制。此外,我们在多个图像复原任务上对 VmambaIR 进行了全面评估,包括图像去雨、单图像超分辨率和真实世界图像超分辨率。大量实验结果表明,我们提出的 VmambaIR 以少得多的计算资源和参数实现了最先进的(SOTA)性能。我们的研究突显了状态空间模型作为 Transformer 和 CNN 架构的有力替代方案,在作为下一代低级视觉任务基础框架方面的潜力。
引用
@article{arxiv.2403.11423,
title = {VmambaIR: Visual State Space Model for Image Restoration},
author = {Yuan Shi and Bin Xia and Xiaoyu Jin and Xing Wang and Tianyu Zhao and Xin Xia and Xuefeng Xiao and Wenming Yang},
journal= {arXiv preprint arXiv:2403.11423},
year = {2024}
}
备注
23 pages