中文

视觉数据集中的性别伪影

计算机视觉与模式识别 2023-09-19 v3

摘要

已知大规模视觉数据集中存在性别偏见,并可能在下游模型中得到反映甚至放大。许多先前的工作提出了减轻性别偏见的方法,通常试图从图像中移除性别表达信息。为了理解这些方法的可行性与实用性,我们研究了大规模视觉数据集中存在哪些“性别伪影”。我们将“性别伪影”定义为与性别相关的视觉线索,特别关注那些可被现代图像分类器学习且具有可解释的人类对应项的线索。通过分析,我们发现性别伪影在 COCO 和 OpenImages 数据集中普遍存在,从低级信息(例如颜色通道的均值)到图像的高级构成(例如人物的姿态和位置)无处不在。鉴于性别伪影的普遍性,我们认为从这类数据集中移除性别伪影的尝试在很大程度上是不可行的。相反,研究人员和从业者有责任意识到数据集中的图像分布是高度性别化的,并因此开发对这些跨群体分布偏移具有鲁棒性的方法。

关键词

引用

@article{arxiv.2206.09191,
  title  = {Gender Artifacts in Visual Datasets},
  author = {Nicole Meister and Dora Zhao and Angelina Wang and Vikram V. Ramaswamy and Ruth Fong and Olga Russakovsky},
  journal= {arXiv preprint arXiv:2206.09191},
  year   = {2023}
}

备注

ICCV 2023