中文

资源约束下用于提升数据集质量的主动标签清洗

计算机视觉与模式识别 2022-04-25 v2 机器学习

摘要

数据标注中的缺陷(即标签噪声)不利于机器学习模型的训练,并对模型性能评估产生常被忽视的混淆效应。然而,在如医疗等资源受限环境下,雇用专家通过完全重新标注大型数据集来消除标签噪声并不可行。本工作倡导一种数据驱动的方法来优先处理需重新标注的样本——我们称之为“主动标签清洗”。我们提出依据每样本估计的标签正确性与标注难度进行排序,并引入一种仿真框架来评估重标注效能。我们在自然图像及一个新的医学影像基准上的实验表明,清洗噪声标签可缓解其对模型训练、评估与选择的负面影响。关键的是,所提出的主动标签清洗在实际条件下比典型随机选取有效纠正标签达4倍,使专家宝贵时间得以更好用于提升数据集质量。

关键词

引用

@article{arxiv.2109.00574,
  title  = {Active label cleaning for improved dataset quality under resource constraints},
  author = {Melanie Bernhardt and Daniel C. Castro and Ryutaro Tanno and Anton Schwaighofer and Kerem C. Tezcan and Miguel Monteiro and Shruthi Bannur and Matthew Lungren and Aditya Nori and Ben Glocker and Javier Alvarez-Valle and Ozan Oktay},
  journal= {arXiv preprint arXiv:2109.00574},
  year   = {2022}
}

备注

Accepted for publication in Nature Communications