ClipGrader:利用视觉-语言模型进行目标检测中鲁棒的标签质量评估
计算机视觉与模式识别
2025-03-06 v1 人工智能
机器学习
摘要
高质量的标注对于目标检测模型至关重要,但确保标签准确性——尤其是边界框的准确性——仍然既具挑战性又成本高昂。本文提出 ClipGrader,一种利用视觉-语言模型自动评估边界框标注准确性的新方法。通过调整 CLIP(对比语言-图像预训练)来同时评估类别标签正确性与边界框的空间精度,ClipGrader 提供了对目标检测标签进行评分的有效方案。在人工扰动边界框的修改版目标检测数据集上进行测试后,ClipGrader 在 COCO 上达到 91% 的准确率、1.8% 的假阳性率。此外,仅使用 COCO 数据的 10% 进行训练时,仍能保持 87% 的准确率和 2.1% 的假阳性率。ClipGrader 还能有效扩展到 LVIS 等更大数据集,在 1,203 个类别上达到 79% 的准确率。我们的实验展示了 ClipGrader 识别现有 COCO 标注中错误的能力,突显了其在数据集精炼方面的潜力。当集成到半监督目标检测(SSOD)模型中时,ClipGrader 能够有效提升伪标签质量,帮助在整个训练过程中实现更高的 mAP(平均精度均值)。因此,ClipGrader 为大规模目标检测数据集中的标注质量控制和标注验证提供了一种可扩展的 AI 辅助工具。
引用
@article{arxiv.2503.02897,
title = {ClipGrader: Leveraging Vision-Language Models for Robust Label Quality Assessment in Object Detection},
author = {Hong Lu and Yali Bian and Rahul C. Shah},
journal= {arXiv preprint arXiv:2503.02897},
year = {2025}
}