数据生产装置
人机交互
2022-05-25 v1 计算机与社会
机器学习
摘要
机器学习(ML)依赖数据来训练和验证模型。组织往往通过业务流程外包(BPO)公司与众包平台将相关数据工作(即生成与标注数据、评估输出)流程外包。本文通过研究委内瑞拉的三个平台与阿根廷的一家 BPO,调查拉丁美洲的外包 ML 数据工作。我们借助福柯式的 dispositif(装置)概念,将数据生产装置定义为话语、行动与对象的集合体,其在数据与劳动中策略性地布署以(再)生产权力/知识关系。我们的装置分析包含对 210 份数据工作指令文档、55 场与数据工人、管理者及需求方的访谈以及参与式观察的考察。我们的发现表明,指令中编码的话语再生产并常态化了需求方的世界观。不稳定的工作条件与经济依赖使工人异化,令其顺从指令。此外,话语与社会语境具现于接口与绩效指标等人工物中,限制了工人的能动性并常态化了特定的数据解读方式。我们最后强调,必须通过对抗异化与不稳定化、赋权数据工人使其成为高质量数据追求中的资产,来抵消数据生产装置。
引用
@article{arxiv.2205.11963,
title = {The Data-Production Dispositif},
author = {Milagros Miceli and Julian Posada},
journal= {arXiv preprint arXiv:2205.11963},
year = {2022}
}
备注
Accepted for publication at CSCW 2022. Forthcoming in the Proceedings of the ACM on Human-Computer Interaction