中文

平衡画面:用合成对比集去偏视觉-语言数据集

计算机视觉与模式识别 2023-05-25 v1

摘要

视觉-语言模型正日益流行并进入公众视野,可大规模生成、编辑和描述图像;但其在互联网上未筛选的图像-文本对预训练中所习得的社会偏见会被输出固化并放大。尽管已有去偏方法被提出,我们认为这些模型偏见的度量因数据集偏见而缺乏效度。我们证明,最常用的偏见评估数据集 COCO Captions 中存在背景上下文与现场人物性别之间的伪相关。这存在问题,因为常用偏见指标(如 Bias@K)依赖于各性别的基准率。为解决此问题,我们提出一种新颖的数据集去偏流程,以合成的、性别平衡的对比集扩充 COCO 数据集,其中仅修改主体的性别而固定背景。然而,现有图像编辑方法存在局限,有时生成低质量图像;因此我们引入一种基于与真实图像相似度自动过滤生成图像的方法。利用我们平衡的合成对比集,我们对多个基于 CLIP 的模型中的偏见进行基准测试,展示了原始 COCO 图像的不平衡如何使指标产生偏斜。我们的结果表明,所提方法提升了评估的效度,最终有助于更真实地理解视觉-语言模型中的偏见。

关键词

引用

@article{arxiv.2305.15407,
  title  = {Balancing the Picture: Debiasing Vision-Language Datasets with Synthetic Contrast Sets},
  author = {Brandon Smith and Miguel Farinha and Siobhan Mackenzie Hall and Hannah Rose Kirk and Aleksandar Shtedritski and Max Bain},
  journal= {arXiv preprint arXiv:2305.15407},
  year   = {2023}
}

备注

Github: https://github.com/oxai/debias-gensynth