中文

构建公平数据集的挑战分类学

机器学习 2024-11-04 v2 计算机与社会

摘要

尽管付出了大量努力以创建更公平的机器学习(ML)数据集,但对数据集构建的实践方面仍缺乏深入了解。基于对 30 位 ML 数据集构建者的访谈,我们提出了一份全面的分类学,涵盖了在数据集构建生命周期中遇到的挑战和权衡。我们的发现强调了影响数据构建的更广泛公平领域内的全局性问题。最后,我们提出了旨在促进系统性变革的建议,以更好地推动公平的数据集构建实践。

关键词

引用

@article{arxiv.2406.06407,
  title  = {A Taxonomy of Challenges to Curating Fair Datasets},
  author = {Dora Zhao and Morgan Klaus Scheuerman and Pooja Chitre and Jerone T. A. Andrews and Georgia Panagiotidou and Shawn Walker and Kathleen H. Pine and Alice Xiang},
  journal= {arXiv preprint arXiv:2406.06407},
  year   = {2024}
}

备注

NeurIPS Datasets & Benchmarks 2024 (Oral)