中文

Mamba YOLO:基于状态空间模型的目标检测简单基线

计算机视觉与模式识别 2024-12-17 v2

摘要

受深度学习技术快速发展的驱动,YOLO系列为实时目标检测器树立了新的标杆。此外,基于Transformer的结构已成为该领域最强大的解决方案,极大地扩展了模型的感受野并实现了显著的性能提升。然而,这种改进是有代价的,因为自注意力机制的二次复杂度增加了模型的计算负担。为了解决这个问题,我们引入了一种简单而有效的基线方法,称为Mamba YOLO。我们的贡献如下:1) 我们提出ODMamba主干网络引入具有线性复杂度的状态空间模型(SSM),以解决自注意力的二次复杂度。与其他基于Transformer和SSM的方法不同,ODMamba无需预训练即可简单训练。2) 为了满足实时性要求,我们设计了ODMamba的宏观结构,确定了最佳阶段比例和缩放尺寸。3) 我们设计了RG Block,它采用多分支结构对通道维度进行建模,解决了SSM在序列建模中可能存在的局限性,例如感受野不足和图像定位能力弱。这种设计更准确、更显著地捕获了局部图像依赖关系。在公开的COCO基准数据集上进行的大量实验表明,与先前方法相比,Mamba YOLO实现了最先进的性能。具体来说,Mamba YOLO的tiny版本在单个4090 GPU上,推理时间为1.5毫秒,mAP提升了7.5%。PyTorch代码可在以下网址获取:https://github.com/HZAI-ZJNU/Mamba-YOLO

关键词

引用

@article{arxiv.2406.05835,
  title  = {Mamba YOLO: A Simple Baseline for Object Detection with State Space Model},
  author = {Zeyu Wang and Chen Li and Huiying Xu and Xinzhong Zhu and Hongbo Li},
  journal= {arXiv preprint arXiv:2406.05835},
  year   = {2024}
}