通过制造标签错误来检测标签错误:面向分割和目标检测数据集的方法
机器学习
2025-08-26 v1 计算机视觉与模式识别
摘要
最近,检测标签错误和改进监督学习任务数据集中标签质量的工作在研究和行业中日益重要。错误标注的数据的后果包括降低模型性能、偏斜基准结果和降低整体准确率。当前的最先进标签错误检测方法通常专注于单个计算机视觉任务,因而针对特定类型的数据集进行工作,可能包含例如边界框或像素级注释。此外,先前的方法不基于学习。在本工作中,我们克服了这一研究空白。我们提出了一种统一的方法,用于检测目标检测、语义分割和实例分割数据集中的标签错误。简而言之,我们的方法——通过制造标签错误来检测标签错误——的工作流程如下:我们注入不同的标签错误类型到 ground truth 中。然后,跨所有提到的主要任务的标签错误检测被建模为基于复合输入的实例分割问题。在我们的实验中,我们比较了本方法在模拟标签错误上的标签错误检测性能与各种基线和各自任务领域的最先进方法的表现。我们还对真实世界标签错误的泛化性进行了研究。此外,我们发布了 459 个在 Cityscapes 数据集中识别出的真实标签错误,并为 Cityscapes 中的真实标签错误检测提供基准。
引用
@article{arxiv.2508.17930,
title = {Learning to Detect Label Errors by Making Them: A Method for Segmentation and Object Detection Datasets},
author = {Sarina Penquitt and Tobias Riedlinger and Timo Heller and Markus Reischl and Matthias Rottmann},
journal= {arXiv preprint arXiv:2508.17930},
year = {2025}
}