中文

关于在数据集中发布标注者层级标签与信息

计算与语言 2021-10-13 v1 计算机与社会

摘要

构建 NLP 数据集(尤其是使用众包标注时)的一种常见做法是获取对同一数据实例的多个标注者判断,然后通过多数投票、平均或裁定将其扁平化以产生单一的“真实”标签或分数。虽然这些方法在某些标注任务中可能是适当的,但此类聚合忽视了人类感知的社会建构本质,而相对更主观任务的标注本应捕捉这种本质。特别是,标注者因其社会文化背景和/或生活经历而产生的系统性分歧常因此类聚合而被模糊化。在本文中,我们实证表明标签聚合可能引入个体与群体视角的代表性偏差。基于这一发现,我们提出一组建议以提升数据集对下游用例的效用与透明度。

关键词

引用

@article{arxiv.2110.05699,
  title  = {On Releasing Annotator-Level Labels and Information in Datasets},
  author = {Vinodkumar Prabhakaran and Aida Mostafazadeh Davani and Mark Díaz},
  journal= {arXiv preprint arXiv:2110.05699},
  year   = {2021}
}