中文

YOLO-MS:重新思考实时目标检测中的多尺度表征学习

计算机视觉与模式识别 2025-02-21 v2

摘要

我们旨在为目标检测领域提供一个高效且性能优越的目标检测器,称为 YOLO-MS。其核心设计基于对基本块的多分支特征以及不同核大小卷积如何影响不同尺度目标检测性能的一系列探究。成果是一种可显著增强实时目标检测器多尺度特征表征的新策略。为验证我们工作的有效性,我们在 MS COCO 数据集上从头训练 YOLO-MS,不依赖任何其他大规模数据集(如 ImageNet)或预训练权重。无需额外技巧,我们的 YOLO-MS 优于近期最先进的实时目标检测器,包括 YOLO-v7、RTMDet 和 YOLO-v8。以 YOLO-MS 的 XS 版本为例,它可在 MS COCO 上达到 42+% 的 AP 分数,比同等模型大小的 RTMDet 高出约 2%。此外,我们的工作也可作为其他 YOLO 模型的即插即用模块。典型地,我们的方法将 YOLOv8-N 的 APs、APl 和 AP 分别从 18%+、52%+ 和 37%+ 显著提升至 20%+、55%+ 和 40%+,且参数与 MACs 更少。代码与训练模型已公开于 https://github.com/FishAndWasabi/YOLO-MS。我们也提供了 Jittor 版本:https://github.com/NK-JittorCV/nk-yolo。

关键词

引用

@article{arxiv.2308.05480,
  title  = {YOLO-MS: Rethinking Multi-Scale Representation Learning for Real-time Object Detection},
  author = {Yuming Chen and Xinbin Yuan and Jiabao Wang and Ruiqi Wu and Xiang Li and Qibin Hou and Ming-Ming Cheng},
  journal= {arXiv preprint arXiv:2308.05480},
  year   = {2025}
}

备注

13 pages, 8 figures