中文

基于深度学习与不确定性量化的语义分割数据集标签错误自动检测

计算机视觉与模式识别 2024-08-27 v2 机器学习

摘要

在本工作中,我们首次提出一种用于检测具有语义分割(即像素级类别标签)的图像数据集中标签错误的方法。语义分割数据集的标注获取耗时且需要大量人力。特别是,审查过程耗时,且人类很容易忽略标签错误。其后果是基准存在偏差,极端情况下还会导致在此类数据集上训练的深度神经网络(DNNs)性能下降。用于语义分割的DNNs产生像素级预测,这使得通过不确定性量化检测标签错误成为一项复杂任务。不确定性在预测连通分量之间的过渡处尤为明显。通过将不确定性的考量提升到预测分量层面,我们使得DNNs与分量级不确定性量化相结合以检测标签错误成为可能。我们提出了一种原则性方法,通过从Cityscapes数据集以及从CARLA驾驶模拟器提取的数据集(后者标签可控)中丢弃标签,来对标签错误检测任务进行基准测试。我们的实验表明,该方法在控制误检数量的同时能够检测绝大多数标签错误。此外,我们将该方法应用于计算机视觉界常用的语义分割数据集,并给出了一系列标签错误及样本统计。

关键词

引用

@article{arxiv.2207.06104,
  title  = {Automated Detection of Label Errors in Semantic Segmentation Datasets via Deep Learning and Uncertainty Quantification},
  author = {Matthias Rottmann and Marco Reese},
  journal= {arXiv preprint arXiv:2207.06104},
  year   = {2024}
}