中文

应对目标检测数据集中的噪声标签

计算机视觉与模式识别 2023-12-12 v3 人工智能

摘要

深度神经网络训练数据集的质量是影响所得模型准确性的关键因素。这一效应在目标检测等困难任务中被放大。处理数据集中的错误通常局限于接受一部分示例不正确、估计其置信度,并在训练期间分配适当权重或忽略不确定者。在本工作中,我们提出一种不同方法。我们引入用于目标检测中置信学习(CLOD)算法,以评估目标检测数据集中每个标签的质量,识别缺失、虚假、错标和错位的边界框并提出修正。通过聚焦于发现训练数据集中的不正确示例,我们可以从根源上消除它们。可疑边界框可被审查以改善数据集质量,从而在不进一步复杂化其本已复杂架构的情况下得到更好的模型。所提方法能够以低于 0.1 的假阳性率指出近 80% 的人工扰动边界框。通过应用最置信的自动建议来清理数据集,在不同数据集上 mAP 分数提升了 16% 至 46%,且未对网络架构做任何修改。该方法在纠正最先进目标检测数据集方面展现出有前景的潜力。

关键词

引用

@article{arxiv.2211.13993,
  title  = {Combating noisy labels in object detection datasets},
  author = {Krystian Chachuła and Jakub Łyskawa and Bartłomiej Olber and Piotr Frątczak and Adam Popowicz and Krystian Radlak},
  journal= {arXiv preprint arXiv:2211.13993},
  year   = {2023}
}

备注

13 pages, 16 figures, submitted to ICDE 2024 Conference