YOLOv12:面向注意力中心的实时目标检测器
计算机视觉与模式识别
2025-02-19 v1 人工智能
摘要
YOLO 框架的网络架构一直是提升关键,但主要聚焦于基于 CNN 的改进,尽管注意力机制在建模能力方面已被证明优于 CNN。这是由于基于注意力的模型无法匹配基于 CNN 的模型的速度。这篇论文提出了一个以注意力为中心的 YOLO 框架,称为 YOLOv12,能够匹配之前基于 CNN 的模型的速度,同时发挥注意力机制的性能优势。YOLOv12 在准确率上超过了所有流行的实时目标检测器,同时保持竞争的速度。例如,YOLOv12-N 在 T4 GPU 上实现 40.6% 的 mAP,推理延迟仅为 1.64 ms,超越了高级的 YOLOv10-N / YOLOv11-N 提高了 2.1%/1.2% 的 mAP,同时保持相当的速度。这一优势也适用于其他模型规模。YOLOv12 还超过了改进 DETR 的端到端实时检测器,如 RT-DETR / RT-DETRv2:YOLOv12-S 在运行速度上超过 RT-DETR-R18 / RT-DETRv2-R18 快 42%,仅使用 36% 的计算量和 45% 的参数。更多比较见图 1。
引用
@article{arxiv.2502.12524,
title = {YOLOv12: Attention-Centric Real-Time Object Detectors},
author = {Yunjie Tian and Qixiang Ye and David Doermann},
journal= {arXiv preprint arXiv:2502.12524},
year = {2025}
}
备注
https://github.com/sunsmarterjie/yolov12