受状态空间模型启发的可分离自注意力方法:为计算机视觉设计
计算机视觉与模式识别
2025-05-21 v2 人工智能
摘要
Mamba 是一种具有线性计算复杂度的高效状态空间模型(SSM)。虽然 SSM 不适用于处理非因果数据,但 Vision Mamba(ViM)方法在图像分类和目标检测等任务中仍显示出良好的性能。最近的研究表明,状态空间模型与注意力变体之间存在丰富的理论联系。我们提出了一种新颖的可分离自注意力方法,首次将 Mamba 的一些优秀设计概念引入可分离自注意力。为确保与 ViM 进行公平比较,我们引入了 VMINet—a 个简单而强大的原型架构,仅由堆叠 novel attention 模块和最基本的下采样层构建。值得注意的是,VMINet 与传统 Transformer 架构有显著区别。我们的实验表明,VMINet 在图像分类和高分辨率密集预测任务中取得了具竞争力的结果。代码已公开:https://github.com/yws-wxs/VMINet。
关键词
引用
@article{arxiv.2501.02040,
title = {A Separable Self-attention Inspired by the State Space Model for Computer Vision},
author = {Juntao Zhang and Shaogeng Liu and Kun Bian and You Zhou and Pei Zhang and Jianning Liu and Jun Zhou and Bingyan Liu},
journal= {arXiv preprint arXiv:2501.02040},
year = {2025}
}