中文

受状态空间模型启发的可分离自注意力方法:为计算机视觉设计

计算机视觉与模式识别 2025-05-21 v2 人工智能

摘要

Mamba 是一种具有线性计算复杂度的高效状态空间模型(SSM)。虽然 SSM 不适用于处理非因果数据,但 Vision Mamba(ViM)方法在图像分类和目标检测等任务中仍显示出良好的性能。最近的研究表明,状态空间模型与注意力变体之间存在丰富的理论联系。我们提出了一种新颖的可分离自注意力方法,首次将 Mamba 的一些优秀设计概念引入可分离自注意力。为确保与 ViM 进行公平比较,我们引入了 VMINet—a 个简单而强大的原型架构,仅由堆叠 novel attention 模块和最基本的下采样层构建。值得注意的是,VMINet 与传统 Transformer 架构有显著区别。我们的实验表明,VMINet 在图像分类和高分辨率密集预测任务中取得了具竞争力的结果。代码已公开:https://github.com/yws-wxs/VMINet。

关键词

引用

@article{arxiv.2501.02040,
  title  = {A Separable Self-attention Inspired by the State Space Model for Computer Vision},
  author = {Juntao Zhang and Shaogeng Liu and Kun Bian and You Zhou and Pei Zhang and Jianning Liu and Jun Zhou and Bingyan Liu},
  journal= {arXiv preprint arXiv:2501.02040},
  year   = {2025}
}