实时目标检测模型的复制研究与基准测试
计算机视觉与模式识别
2025-09-05 v2
摘要
本工作考察了最新实时目标检测模型的可重复性与基准测试。由于目标检测模型常用于机器人等实际场景,推理时间至关重要,仅测量模型的准确率不足以进行比较。因此,我们在多个图形处理卡上对大量目标检测模型的准确率和推理速度进行比较。除了这大规模基准测试尝试外,我们还使用 PyTorch 在 MS COCO 2017 数据集上从零重现以下模型:DETR、RTMDet、ViTDet 和 YOLOv7。更重要的是,我们提出了一个基于 MMDetection 功能的统一训练与评估管道,以更好地进行模型比较。我们的 DETR 和 ViTDet 实现无法实现与原论文中声明的准确率或速度性能相当。相反,重现的 RTMDet 和 YOLOv7 能够匹配此类性能。研究论文在可重复性方面通常欠缺。就 MMDetection 预训练模型而言,计算资源有限时速度性能严重下降(更大、更精确的模型影响更大)。此外,结果显示准确率与速度之间存在强烈权衡,由无锚框模型主导——尤其是 RTMDet 或 YOLOx 模型。本论文及所有实验使用的代码均可于 https://github.com/willGuimont/segdet_mlcr2024 获取。
引用
@article{arxiv.2405.06911,
title = {Replication Study and Benchmarking of Real-Time Object Detection Models},
author = {Pierre-Luc Asselin and Vincent Coulombe and William Guimont-Martin and William Larrivée-Hardy},
journal= {arXiv preprint arXiv:2405.06911},
year = {2025}
}
备注
Authors are presented in alphabetical order, each having equal contribution to the work