RF-DETR 目标检测 vs YOLOv12:在标签不明确的复杂果园环境下评估基于 Transformer 的 CNN-based 架构的单类与多类绿果检测
计算机视觉与模式识别
2025-04-18 v1
摘要
本研究对比评估了 RF-DETR 目标检测基座模型和 YOLOv12 目标检测模型配置,用于检测标记不明确、遮挡和背景混合的复杂果园中的绿果。开发了包含单类(绿果)和多类(遮挡与非遮挡绿果)注释的自定义数据集,以评估在动态真实环境下的模型性能。RF-DETR 目标检测模型采用 DINOv2 背板和可变形注意力,在全局上下文建模方面表现突出,有效识别部分遮挡或模糊的绿果。相比之下,YOLOv12 利用 CNN-based 注意力实现局部特征提取,针对计算效率和边缘部署进行了优化。RF-DETR 在单类检测中实现了最高的 mean Average Precision (mAP50) 为 0.9464,证明其在杂乱场景中局部绿果的定位能力优越。尽管 YOLOv12N 在 mAP@50:95 为 0.7620 时表现最佳,RF-DETR 在复杂空间场景中整体表现更为一致。对于多类检测,RF-DETR 以 mAP@50 为 0.8298 领先,展示了其区分遮挡与非遮挡水果的能力,而 YOLOv12L 在 mAP@50:95 为 0.6622 时得分最高,表明其在详细遮挡情境下的分类能力更强。训练动力学分析显示,RF-DETR 在单类设置下迅速收敛,仅需 10 个 epoch 即达到平台期,凸显了基于 Transformer 的架构在动态视觉数据适应方面的效率。这些发现验证了 RF-DETR 在精密农业应用中的有效性,而 YOLOv12 则适用于快速响应场景。
引用
@article{arxiv.2504.13099,
title = {RF-DETR Object Detection vs YOLOv12 : A Study of Transformer-based and CNN-based Architectures for Single-Class and Multi-Class Greenfruit Detection in Complex Orchard Environments Under Label Ambiguity},
author = {Ranjan Sapkota and Rahul Harsha Cheppally and Ajay Sharda and Manoj Karkee},
journal= {arXiv preprint arXiv:2504.13099},
year = {2025}
}