中文

厘清机器学习众包工人的受试者身份地位

计算机与社会 2023-06-19 v2 人工智能 计算与语言 机器学习 机器学习

摘要

近年来,机器学习(ML)在构建数据集以及处理需要人类交互或判断的研究问题方面严重依赖众包工人。所执行的任务多样且所产生数据的用途广泛,使得难以确定众包工人何时最好被视为工人(相对于受试者)。这些困难因相互冲突的政策而加剧:一些机构和研究者将所有 ML 众包工人视为受试者,而另一些则认为他们很少构成受试者。值得注意的是,涉及众包工作的 ML 论文极少提及 IRB 监督,引发了未遵守伦理与监管要求的担忧。我们调查 ML 众包研究的适当认定,将探究聚焦于自然语言处理以揭示研究监督所面临的独特挑战。关键的是,根据美国通用规则(Common Rule),这些判断取决于关于“主题性”(aboutness)的判定,涉及所收集数据是关于谁(或什么)以及分析是关于谁(或什么)。我们强调了 ML 带来的两个挑战:同一批工人可充当多种角色并提供多种信息;且 ML 研究往往采用动态工作流,研究问题很少事先陈述,而数据共享为未来研究以不同目标提出问题打开了大门。我们的分析揭示了通用规则中的一个潜在漏洞,研究者可通过将数据收集与分析拆分为不同研究来规避研究伦理监督。最后,我们提出了若干政策建议以应对这些问题。

关键词

引用

@article{arxiv.2206.04039,
  title  = {Resolving the Human Subjects Status of Machine Learning's Crowdworkers},
  author = {Divyansh Kaushik and Zachary C. Lipton and Alex John London},
  journal= {arXiv preprint arXiv:2206.04039},
  year   = {2023}
}