中文

审计 ImageNet:面向大规模图像数据集人口属性标注的模型驱动框架

机器学习 2019-06-06 v2 计算与语言 计算机与社会

摘要

ImageNet 数据集引发了学术界与工业界对计算机视觉应用深度学习的浓厚兴趣。尽管影响重大,但尚未对该数据集所含图像的人口属性进行全面调查。此类研究可揭示 ImageNet 中固有偏差的新见解,尤其考虑到它常被用于为各类计算机视觉任务预训练模型。本工作中,我们引入了一种模型驱动框架,用于大规模图像数据集中表观年龄与性别属性的自动标注。利用该框架,我们对 ImageNet 的 2012 ImageNet 大规模视觉识别挑战赛(ILSVRC)子集及 ImageNet 的“人”层级类别进行了首次人口统计审计。我们发现 ILSVRC 中 41.62% 的人脸显示为女性,1.71% 显示为 60 岁以上个体,15 至 29 岁男性占比最大,为 27.11%。我们注意到所提出的模型驱动框架对所有交叉群体并非公平,因此标注存在偏差。我们将此工作作为未来开发无偏标注模型以及研究 ImageNet 人口统计不平衡下游效应的起点。代码与标注见:http://bit.ly/ImageNetDemoAudit

关键词

引用

@article{arxiv.1905.01347,
  title  = {Auditing ImageNet: Towards a Model-driven Framework for Annotating Demographic Attributes of Large-Scale Image Datasets},
  author = {Chris Dulhanty and Alexander Wong},
  journal= {arXiv preprint arXiv:1905.01347},
  year   = {2019}
}

备注

To appear in the Workshop on Fairness Accountability Transparency and Ethics in Computer Vision (FATE CV) at CVPR 2019