DART:一种基于数据多样化、开放词汇边界框注释、伪标签审查和模型训练的自动化 end-to-end 目标检测管道
计算机视觉与模式识别
2025-06-24 v4 人工智能
摘要
准确的实时目标检测在诸多工业应用中至关重要,从安全监控到质量控制。然而,传统方法受限于繁琐的手动标注和数据收集,难以适应不断变化的环境和新目标对象。为此,本文提出了 DART,一种创新的自动化 end-to-end 管道,彻底变革了从数据收集到模型评估的目标检测工作流程。它无需人工标注和大规模数据收集,即可在多样化场景中实现卓越的检测精度。DART 包含四个关键阶段:(1) 使用主导驱动的图像生成进行数据多样化(DreamBooth with SDXL),(2) 通过开放词汇目标检测(Grounding DINO)生成边界框和类别标签,(3) 由大型多模态模型(InternVL-1.5 和 GPT-4o)审查生成的图像和伪标签,以确保可信度,(4) 使用验证后的数据训练实时目标检测器(YOLOv8 和 YOLOv10)。我们将 DART 应用于自行收集的名为 Liebherr Product 的建筑机械数据集,其中包含超过 15000 张高质量图像,覆盖 23 个类别。DART 的当前实现将平均精度(AP)显著提升至 0.832。其模块化设计确保易于替换和扩展,未来可轻松集成新的目标类别,适应定制化环境,无需人工标注和额外数据收集。代码和数据集已发布于 https://github.com/chen-xin-94/DART。
引用
@article{arxiv.2407.09174,
title = {DART: An Automated End-to-End Object Detection Pipeline with Data Diversification, Open-Vocabulary Bounding Box Annotation, Pseudo-Label Review, and Model Training},
author = {Chen Xin and Andreas Hartel and Enkelejda Kasneci},
journal= {arXiv preprint arXiv:2407.09174},
year = {2025}
}
备注
Corrected minor typos; no changes to results or conclusions