中文

无监督预训练习得的图像表示含有类人偏见

计算机与社会 2021-01-28 v3 计算机视觉与模式识别

摘要

机器学习的最新进展利用来自网络的大规模无标签图像数据集,学习用于从图像分类到人脸识别等任务的通用图像表示。但是,无监督计算机视觉模型是否会自动学习隐含模式并嵌入可能产生有害下游效应的社会偏见?我们开发了一种新颖的方法,用于量化图像中社会概念与属性表示之间的偏见关联。我们发现,在 ImageNet(一个从网络图像中整理出的流行基准图像数据集)上训练的最先进无监督模型,会自动学习种族、性别和交叉性偏见。我们复现了社会心理学中 8 个先前有记载的人类偏见,从无害的(如昆虫和花)到潜在有害的(如种族和性别)。我们的结果与社会心理学中关于交叉偏见的三个假设高度吻合。在无监督计算机视觉中,我们还首次量化了关于体重、残疾和若干族裔的隐含人类偏见。与在线图像数据集中的统计模式相比,我们的发现表明机器学习模型可以自动从网络上对人们的刻板描绘方式中学习偏见。

关键词

引用

@article{arxiv.2010.15052,
  title  = {Image Representations Learned With Unsupervised Pre-Training Contain Human-like Biases},
  author = {Ryan Steed and Aylin Caliskan},
  journal= {arXiv preprint arXiv:2010.15052},
  year   = {2021}
}

备注

10 pages, 3 figures. Replaced example image completions of real people with completions of artificial people