研究机器学习数据:为何在意指权力时却谈论偏见?
人机交互
2021-09-17 v1 计算机与社会
机器学习
摘要
机器学习(ML)的研究主要认为,在不完整或有偏数据集上训练的模型会导致歧视性输出。在本评论中,我们提议采用一种权力觉察的视角来“向上研究”ML数据集,从而将研究焦点从以偏见为导向的框架中移开。这意味着要考虑数据中铭刻的历史不平等、劳动条件与认识论立场。我们借助 HCI 与 CSCW 的工作来支持我们的论点,批判性地分析先前的研究,并指出我们社群内两条共存的工作路线——一条以偏见为导向,另一条以权力觉察为导向。由此,我们强调了在三个领域进行对话与合作的必要性:数据质量、数据工作与数据文档。在第一个领域,我们认为将社会问题简化为“偏见”忽略了数据基于语境的本质。在第二个领域,我们凸显了数据工人劳动中所涉及的企业力量与市场律令,这些力量随后塑造了 ML 数据集。最后,我们提议扩展当前数据集文档中以透明为导向的努力,以反映数据设计与生产的社会语境。
引用
@article{arxiv.2109.08131,
title = {Studying Up Machine Learning Data: Why Talk About Bias When We Mean Power?},
author = {Milagros Miceli and Julian Posada and Tianling Yang},
journal= {arXiv preprint arXiv:2109.08131},
year = {2021}
}
备注
Accepted at ACM Group 2022. Forthcoming on Proceedings of the ACM on Human-Computer Interaction