中文

谁的真实标准?审视数据集标注背后的个体与集体身份

机器学习 2024-03-14 v1

摘要

人工标注在机器学习(ML)研究与开发中扮演着关键角色。然而,围绕构建 ML 数据集的过程与决策所产生的伦理考量,尚未得到足够重视。本文综述了一系列文献,这些文献为围绕众包数据集标注的伦理考量提供了洞见。我们综合这些洞见,并从两个层面阐述了该领域的挑战:(1)标注者是谁,以及标注者的生活经历如何影响其标注结果;(2)标注者与众包平台之间的关系,以及这种关系为他们带来了什么。最后,我们为 ML 数据流水线各阶段的数据集开发者提出了一套具体的建议与考量事项:任务制定、标注者选择、平台与基础设施选择、数据集分析与评估,以及数据集文档编制与发布。

关键词

引用

@article{arxiv.2112.04554,
  title  = {Whose Ground Truth? Accounting for Individual and Collective Identities Underlying Dataset Annotation},
  author = {Remi Denton and Mark Díaz and Ian Kivlichan and Vinodkumar Prabhakaran and Rachel Rosen},
  journal= {arXiv preprint arXiv:2112.04554},
  year   = {2024}
}