大规模图像数据集:计算机视觉的一场惨胜?
摘要
在本文中,我们调查了大规模视觉数据集中有问题的实践与后果。我们审视了诸如同意与正义的宽泛议题,以及诸如数据集中包含可证实色情图像等具体关切。以 ImageNet-ILSVRC-2012 数据集为例,我们执行了一项基于模型的横截面量化普查,涵盖年龄、性别、NSFW 内容评分、类级准确率、人类基数分析,以及图像类信息的语义性等因子,以统计调查伦理违规的程度与微妙之处。随后我们利用该普查辅助人工策划出 ImageNet-ILSVRC-2012 数据集中落入可证实色情类别的图像查找表:非自愿场景拍摄(偷拍裙底)、海滩偷窥,以及暴露隐私部位。我们调查了由于不加批判与欠考虑的数据集策划实践,社会整体与个体所面临的危害与威胁图景。接着我们提出了可能的纠正路径并 critique 了这些路径的利弊。我们已妥善开源了本工作中生成的所有代码与普查元数据集,供计算机视觉界在此基础上继续构建。通过揭示威胁的严重性,我们希望推动为大规模数据集策划过程设立强制性的机构审查委员会(IRB)。
引用
@article{arxiv.2006.16923,
title = {Large image datasets: A pyrrhic win for computer vision?},
author = {Vinay Uday Prabhu and Abeba Birhane},
journal= {arXiv preprint arXiv:2006.16923},
year = {2020}
}
备注
Github: https://github.com/vinayprabhu/Dataset_audits. Update on July 23rd: (1) Added in the supplementary section (2) The curators of the Tiny Images dataset decided to withdraw the dataset in response to the previous version of this paper, a change that has duly been reflected in this version. Their statement: https://groups.csail.mit.edu/vision/TinyImages/