中文

面向视觉任务的旋转等变 Mamba

计算机视觉与模式识别 2026-04-07 v2

摘要

旋转等变性是视觉数据中最通用且关键的结构先验之一,然而在当前基于 Mamba 的视觉架构中却明显缺失。尽管 Mamba 在自然语言处理方面取得成功, 并在计算机视觉领域得到广泛应用,但现有的视觉 Mamba 模型在设计时未能考虑旋转对称性。这种疏漏使得模型对图像旋转本质上具有敏感性,从而限制了其鲁棒性和跨任务的泛化能力。为解决这一局限,我们将旋转对称性——一种普遍且根本的图像几何先验——融入 Mamba 架构中。具体而言,我们提出了 EQ-VMamba,这是首个面向视觉任务的旋转等变视觉 Mamba 架构。EQ-VMamba 的核心组件包括精心设计的旋转等变跨扫描策略和群 Mamba 块。此外,我们对该架构的内在等变误差进行了严格的理论分析,证明了所提出的架构在整个网络中实现了端到端的旋转等变性。广泛的实验在多个基准上——包括高层图像分类、中层语义分割和低层图像超分辨率——都表明,EQ-VMamba 在提高旋转鲁棒性方面始终表现出色, 并以优异或具竞争力的性能超过非等变基线,同时只需约 50% 的参数。这些结果表明, 将旋转等变性嵌入视觉 Mamba 模型,不仅有效地增强了其抗旋转变换的鲁棒性,而且在显著提高参数效率的同时,还提升了整体性能。代码已公开于 https://github.com/zhongchenzhao/EQ-VMamba。

关键词

引用

@article{arxiv.2603.09138,
  title  = {Rotation Equivariant Mamba for Vision Tasks},
  author = {Zhongchen Zhao and Qi Xie and Keyu Huang and Lei Zhang and Deyu Meng and Zongben Xu},
  journal= {arXiv preprint arXiv:2603.09138},
  year   = {2026}
}