中文

缓解数据集危害需要管理:来自 1000 篇论文的经验教训

机器学习 2021-11-23 v2 计算机与社会

摘要

机器学习数据集已引发关于隐私、偏见和不道德应用的担忧,导致 DukeMTMC、MS-Celeb-1M 和 Tiny Images 等著名数据集被撤回。作为回应,机器学习社区呼吁在数据集创建中遵循更高的伦理标准。为助力这些工作,我们研究了三个有影响力但存在伦理问题的人脸和人物识别数据集——Labeled Faces in the Wild (LFW)、MS-Celeb-1M 和 DukeMTM——通过分析近 1000 篇引用它们的论文。我们发现,衍生数据集和模型的创建、更广泛的技术与社会变革、许可证的不清晰以及数据集管理实践会引入广泛的伦理担忧。最后我们建议采用一种考虑数据集整个生命周期的分布式危害缓解方法。

关键词

引用

@article{arxiv.2108.02922,
  title  = {Mitigating Dataset Harms Requires Stewardship: Lessons from 1000 Papers},
  author = {Kenny Peng and Arunesh Mathur and Arvind Narayanan},
  journal= {arXiv preprint arXiv:2108.02922},
  year   = {2021}
}