中文

来自档案的启示:机器学习中社会文化数据收集策略

机器学习 2019-12-24 v1 人工智能 计算机与社会

摘要

越来越多的工作表明,机器学习系统在公平性、问责制、透明性与伦理方面的许多问题根植于围绕数据收集与标注过程的决策。尽管其具基础性,数据收集仍是机器学习(ML)流程中被忽视的一环。本文中我们主张,应在 ML 内部形成一个专注于数据收集与标注方法论的新专业方向:此类工作需制度框架与规程。尤其对于社会文化数据,可从档案馆与图书馆汲取类比。档案馆是收集人类信息最悠久的共同体努力,档案学者已发展出语言与规程来应对并讨论诸多数据收集挑战,如同意、权力、包容性、透明性以及伦理与隐私。我们讨论档案文献收集实践中这五种关键方法,以启示社会文化 ML 中的数据收集。通过展示另一领域的数据收集实践,我们鼓励 ML 研究在数据收集上更具自觉与系统性,并借鉴跨学科专长。

关键词

引用

@article{arxiv.1912.10389,
  title  = {Lessons from Archives: Strategies for Collecting Sociocultural Data in Machine Learning},
  author = {Eun Seo Jo and Timnit Gebru},
  journal= {arXiv preprint arXiv:1912.10389},
  year   = {2019}
}

备注

To be published in Conference on Fairness, Accountability, and Transparency FAT* '20, January 27-30, 2020, Barcelona, Spain. ACM, New York, NY, USA, 11 pages