数据及其(不满)内容:机器学习研究中数据集开发与使用综述
机器学习
2021-11-16 v1
摘要
数据集在机器学习研究的发展中发挥了基础性作用。它们构成了我们设计和部署的模型的基础,也是我们进行基准测试和评估的主要媒介。此外,我们收集、构建和共享这些数据集的方式决定了该领域所追求的问题类型以及算法开发中所探索的方法。然而,近期来自广泛视角的研究揭示了数据集收集和使用中主流实践的局限性。在本文中,我们综述了关于机器学习中数据收集与使用方式所提出的诸多关切,并主张有必要对数据建立更谨慎和透彻的理解,以解决该领域的若干实际与伦理问题。
引用
@article{arxiv.2012.05345,
title = {Data and its (dis)contents: A survey of dataset development and use in machine learning research},
author = {Amandalynne Paullada and Inioluwa Deborah Raji and Emily M. Bender and Emily Denton and Alex Hanna},
journal= {arXiv preprint arXiv:2012.05345},
year = {2021}
}