通过损失检查识别目标检测数据集中的标注错误
计算机视觉与模式识别
2023-12-20 v3 机器学习
摘要
为监督式目标检测标注数据集是一项枯燥且耗时的任务。在标注过程中容易引入错误,并在审查时被忽略,从而产生不准确的基准以及在与噪声标签上训练的深度神经网络性能下降。在本工作中,我们首次提出了一个面向目标检测数据集的标注错误检测方法的基准,以及一种标注错误检测方法与若干基线。我们在标注良好的目标检测数据集的训练集和测试集上模拟了四种不同类型的随机引入的标注错误。对于我们的标注错误检测方法,我们假设给定一个两阶段目标检测器,并考虑两个阶段分类与回归损失之和。这些损失是针对预测与包含模拟标注错误的噪声标签计算的,旨在检测后者。我们将我们的方法与三种基线进行比较:一种无深度学习的朴素方法、目标检测器的分数以及分类 softmax 分布的熵。我们优于所有基线,并证明在所考虑的方法中,我们的方法是唯一能高效检测全部四种类型标注错误的方法。此外,我们检测了 a) 目标检测中常用测试数据集与 b) 一个专有数据集上的真实标注错误。在这两种情况下我们都实现了低误报率,即我们检测标注错误的精度在 a) 中高达 71.5%,在 b) 中为 97%。
引用
@article{arxiv.2303.06999,
title = {Identifying Label Errors in Object Detection Datasets by Loss Inspection},
author = {Marius Schubert and Tobias Riedlinger and Karsten Kahl and Daniel Kröll and Sebastian Schoenen and Siniša Šegvić and Matthias Rottmann},
journal= {arXiv preprint arXiv:2303.06999},
year = {2023}
}