中文

将人重新带回:质疑基准机器学习数据集

计算机与社会 2024-03-14 v1

摘要

针对嵌入社会技术系统中的算法不公平,学界已大量关注机器学习数据集的内容,这些数据集暴露出对白人、顺性别、男性和西方数据主体的偏见。相比之下,此类数据集中嵌入的历史、价值观和规范所受关注较少。本工作中,我们勾勒了一个研究纲领——机器学习数据的谱系学——以考察这些数据集如何及为何被创建、何种及谁的价值影响了数据收集的选择、其创建的语境与偶然条件。我们描述了机器学习中的基准数据集作为基础设施运作的方式,并针对这些数据集提出四个研究问题。这一审问迫使我们“将人重新带回”,因为它有助于我们理解数据集构建中嵌入的劳动,从而为其他接触该数据的研究者提供新的质疑途径。

关键词

引用

@article{arxiv.2007.07399,
  title  = {Bringing the People Back In: Contesting Benchmark Machine Learning Datasets},
  author = {Remi Denton and Alex Hanna and Razvan Amironesei and Andrew Smart and Hilary Nicole and Morgan Klaus Scheuerman},
  journal= {arXiv preprint arXiv:2007.07399},
  year   = {2024}
}