中文

YOLO26:一种无NMS的端到端实时目标检测框架分析

计算机视觉与模式识别 2026-03-19 v2 人工智能

摘要

``You Only Look Once''(YOLO)框架长期以来一直是实时目标检测的标准,尽管传统版本使用非最大抑制(NMS)后处理,引入了特定的延迟和超参数变量。本文对YOLO26的全面架构分析,介绍了该模型如何通过消除NMS而转向原生端到端学习策略。本研究考察了推动这一框架的核心机制:用于背板稳定的MuSGD优化器、面向小目标的标签分配(STAL),以及ProgLoss用于动态监督。为 contextualize 其性能,本文审阅了来自 COCO \texttt{val2017} 评估板的全面基准数据。该评估提供了对YOLO26在各种模型规模(Nano至Extra-Large)在先前CNN系列和当代Transformer架构(如RT-DETR、DEIM、RF-DETR)之间的客观比较,详述了观察到的速度-精度权衡和参数要求,同时不宣称单一最优模型。此外,分析涵盖了该框架的统一多任务能力,包括用于可提示检测的YOLOE-26开放词汇模块。最终,本文旨在记录无需通过启发式后处理来分离表示学习对现代边缘计算机视觉部署中“导出差距”和确定性延迟的影响。

关键词

引用

@article{arxiv.2601.12882,
  title  = {YOLO26: An Analysis of NMS-Free End to End Framework for Real-Time Object Detection},
  author = {Sudip Chakrabarty},
  journal= {arXiv preprint arXiv:2601.12882},
  year   = {2026}
}