中文

dopanim:来自多人类标注者的带噪声标注的仿生动物数据集

计算机视觉与模式识别 2024-07-31 v1

摘要

人类标注者通常为训练机器学习模型(如神经网络)提供标注数据。然而,人类标注存在噪声,会损害泛化性能。对抗噪声标注的方法学研究需要相应的数据集来进行有意义的经验评估。因此,我们引入了一个新的基准数据集dopanim,包含约15750张15类动物图像及其真实标签。其中约10500张图像由20个人提供了超过52000条标注,准确率约67%。其关键特征包括:(1)分类仿生动物的挑战性任务,(2)人类估计的可能性作为标注,以及(3)标注者元数据。我们使用七种该数据集变体对知名多标注者学习方法进行了基准测试,并概述了进一步评估用例,如超越硬类别标签的学习和主动学习。我们的数据集和综合代码库公开发布,以模拟数据收集过程并复现所有经验结果。

关键词

引用

@article{arxiv.2407.20950,
  title  = {dopanim: A Dataset of Doppelganger Animals with Noisy Annotations from Multiple Humans},
  author = {Marek Herde and Denis Huseljic and Lukas Rauch and Bernhard Sick},
  journal= {arXiv preprint arXiv:2407.20950},
  year   = {2024}
}

备注

Under review @ NeurIPS 2024 (Datasets and Benchmarks Track)