中文

CrowdWorkSheets:对众包数据集标注背后的个体与集体身份进行考量

人机交互 2022-06-22 v1 机器学习

摘要

人工标注数据在机器学习(ML)研究和开发中起着至关重要的作用。然而,围绕数据集标注的过程和决策的伦理考量尚未得到足够的重视。在本文中,我们调研了一系列文献,这些文献为围绕众包数据集标注的伦理考量提供了见解。我们综合了这些见解,并沿着两个层面阐述了该领域的挑战:(1)标注者是谁,以及标注者的生活经历如何影响其标注;(2)标注者与众包平台之间的关系,以及这种关系赋予了他们什么。最后,我们引入了一个新颖的框架CrowdWorkSheets,供数据集开发者使用,以促进在数据标注流程的各个阶段对关键决策点进行透明记录:任务制定、标注者选择、平台和基础设施选择、数据集分析和评估,以及数据集发布和维护。

关键词

引用

@article{arxiv.2206.08931,
  title  = {CrowdWorkSheets: Accounting for Individual and Collective Identities Underlying Crowdsourced Dataset Annotation},
  author = {Mark Diaz and Ian D. Kivlichan and Rachel Rosen and Dylan K. Baker and Razvan Amironesei and Vinodkumar Prabhakaran and Emily Denton},
  journal= {arXiv preprint arXiv:2206.08931},
  year   = {2022}
}

备注

11 pages, Accepted at 2022 ACM Conference on Fairness, Accountability, and Transparency (FAccT). arXiv admin note: text overlap with arXiv:2112.04554