YOLOv10:实时端到端目标检测
计算机视觉与模式识别
2024-10-31 v2
摘要
过去几年,YOLO因其在计算成本和检测性能之间的有效平衡,已成为实时目标检测领域的主导范式。研究人员探索了YOLO的架构设计、优化目标、数据增强策略等,取得了显著进展。然而,依赖非极大值抑制(NMS)进行后处理阻碍了YOLO的端到端部署,并对推理延迟产生不利影响。此外,YOLO中各种组件的设计缺乏全面彻底的检查,导致明显的计算冗余并限制了模型能力。这导致了次优的效率,以及相当大的性能改进潜力。在这项工作中,我们旨在从后处理和模型架构两方面进一步推进YOLO的性能-效率边界。为此,我们首先提出了YOLO的无NMS训练的一致双重分配,同时带来了有竞争力的性能和低推理延迟。此外,我们引入了YOLO的整体效率-精度驱动模型设计策略。我们从效率和精度两个角度全面优化了YOLO的各种组件,大大减少了计算开销并增强了能力。我们努力的结果是新一代用于实时端到端目标检测的YOLO系列,称为YOLOv10。大量实验表明,YOLOv10在各种模型规模上实现了最先进的性能和效率。例如,我们的YOLOv10-S在COCO上相似AP下比RT-DETR-R18快1.8倍,同时参数和FLOPs减少2.8倍。与YOLOv9-C相比,YOLOv10-B在相同性能下延迟减少46%,参数减少25%。
引用
@article{arxiv.2405.14458,
title = {YOLOv10: Real-Time End-to-End Object Detection},
author = {Ao Wang and Hui Chen and Lihao Liu and Kai Chen and Zijia Lin and Jungong Han and Guiguang Ding},
journal= {arXiv preprint arXiv:2405.14458},
year = {2024}
}
备注
Code: https://github.com/THU-MIG/yolov10; NeurIPS 2024 Camera-ready Version