基于频域学习的视觉状态空间模型:Vim-F
计算机视觉与模式识别
2025-09-26 v3
摘要
在近年来,具有高效硬件感知设计的状态空间模型(SSMs),即 Mamba 深度学习模型,在建模长序列(如语言理解)方面取得了显著进展。因此,基于 SSMs 构建高效且通用的视觉骨干网络是一个值得期待的方向。与传统卷积神经网络(CNNs)和 Vision Transformer(ViTs)相比,Vision Mamba(ViM)方法的性能尚未完全具竞争力。为了使 SSMs 能够处理图像数据,ViM 通常将 2D 图像展平为 1D 序列,不可避免地忽略了一些 2D 局部依赖关系,从而削弱了模型从全局视角解释空间关系的能力。我们使用快速傅里叶变换(FFT)获取特征图的谱图并添加至原始特征图,使 ViM 能够在频域和空间域中建模统一的视觉表示。频域信息的引入使 ViM 在扫描过程中拥有全局感受野。我们提出了一种新模型 Vim-F,采用纯 Mamba 编码器并在频域和空间域中扫描。此外,我们质疑 ViM 中位置嵌入的必要性,并据此在 Vim-F 中予以移除,这有助于充分利用 ViM 的高效长序列建模能力。最后,我们重新设计了 Vim-F 的 patch 嵌入,利用卷积干线捕获更大的局部关联,从而进一步提高了 Vim-F 的性能。代码已公开:https://github.com/yws-wxs/Vim-F。
引用
@article{arxiv.2405.18679,
title = {Vim-F: Visual State Space Model Benefiting from Learning in the Frequency Domain},
author = {Juntao Zhang and Shaogeng Liu and Jun Zhou and Kun Bian and You Zhou and Jianning Liu and Pei Zhang and Bingyan Liu},
journal= {arXiv preprint arXiv:2405.18679},
year = {2025}
}