中文

利用 Krippendorff Alpha 评估计算机视觉应用中标注数据质量

计算机视觉与模式识别 2019-12-24 v1 机器学习

摘要

当前有监督深度学习框架依赖标注数据来建模给定任务的基础数据分布。特别是对于由深度学习驱动的计算机视觉算法,标注数据的质量是实现预期算法性能的最关键因素。数据标注通常是一个人工过程,标注者遵循指南并以最佳猜测方式操作。标注者之间的标注标准可能在标注结果上表现出差异。这可能影响算法推理性能。鉴于深度学习在计算机视觉中的流行与广泛使用,越来越需要自定义数据集来训练神经网络以应对不同种类的任务。遗憾的是,目前对影响标注数据质量的因素及其如何转化为算法性能尚缺乏充分理解。在本文中,我们针对目标检测与识别研究了该问题。我们进行了若干数据标注实验,以衡量标注者间一致性与一致性程度,以及真值的选择如何影响感知到的算法性能。我们提出了一种在图像标注过程中监控标注质量及其如何用于衡量性能的方法论。我们还表明,忽视对标注过程的监控会导致算法精度显著下降。通过这些实验,我们观察到对标注过程、训练数据以及用于算法评估的真值数据的了解,是准确评估 AI 系统可信度的基本组成部分。

关键词

引用

@article{arxiv.1912.10107,
  title  = {Assessing Data Quality of Annotations with Krippendorff Alpha For Applications in Computer Vision},
  author = {Joseph Nassar and Viveca Pavon-Harr and Marc Bosch and Ian McCulloh},
  journal= {arXiv preprint arXiv:1912.10107},
  year   = {2019}
}

备注

Accepted to AAAI Symposium 2019