中文

迈向数据集标注的共享 rubric

机器学习 2021-12-08 v1

摘要

在安排第三方数据标注时,很难比较相互竞争的供应商在应用最佳实践以创建高质量数据集方面的表现。这导致了“逐底竞争”,即仅基于价格的竞争使供应商难以对高质量标注收费。我们提出一种自愿性 rubric,可用于(a)作为比较供应商产品的记分卡,(b)比现今更清晰一致地传达我们对供应商的期望,(c)证明选择非最低出价方的花费合理,以及(d)鼓励标注提供商改进其实践。

关键词

引用

@article{arxiv.2112.03867,
  title  = {Towards a Shared Rubric for Dataset Annotation},
  author = {Andrew Marc Greene},
  journal= {arXiv preprint arXiv:2112.03867},
  year   = {2021}
}

备注

4 pages. To be presented at the Data-Centric AI Workshop at NeurIPS 2021