中文

MambaNeXt-YOLO: 一种用于实时目标检测的混合状态空间模型

计算机视觉与模式识别 2025-07-25 v3 人工智能

摘要

实时目标检测是计算机视觉中一项基础但具有挑战性的任务,特别是在计算资源有限的情况下。尽管YOLO系列模型通过平衡速度和准确性已建立了强大的基准,但对更丰富的全局上下文建模的需求日益增长,导致了基于Transformer架构的使用。然而,由于自注意力机制,Transformer具有较高的计算复杂度,这限制了其在实时和边缘部署中的实用性。为克服这些挑战,Mamba等线性状态空间模型的最新发展提供了一种有前景的替代方案,通过实现高效序列建模达到线性复杂度。基于这一洞察,我们提出了MambaNeXt-YOLO,一个新颖的目标检测框架,通过三个关键贡献在准确性和效率之间取得平衡:(1) MambaNeXt Block:一种混合设计,将CNN与Mamba集成,有效捕获局部特征和长程依赖;(2) 多分支非对称融合金字塔网络(MAFPN):一种增强的特征金字塔架构,改善了不同物体尺寸的多尺度目标检测;(3) 边缘聚焦效率:我们的方法在PASCAL VOC数据集上实现了66.6% [email protected] FPS,无需任何预训练,并支持在NVIDIA Jetson Xavier NX和Orin NX等边缘设备上的部署。

关键词

引用

@article{arxiv.2506.03654,
  title  = {MambaNeXt-YOLO: A Hybrid State Space Model for Real-time Object Detection},
  author = {Xiaochun Lei and Siqi Wu and Weilin Wu and Zetao Jiang},
  journal= {arXiv preprint arXiv:2506.03654},
  year   = {2025}
}

备注

This paper is under consideration at Image and Vision Computing