中文

多模态偏见:在视觉语言模型中引入超越性别与种族的刻板偏见评估框架

计算机视觉与模式识别 2023-03-23 v1 计算与语言 机器学习

摘要

自监督训练的最新突破催生了一类新的预训练视觉语言模型。尽管已有对多模态模型中偏见的研究,但它们大多聚焦于性别与种族偏见,对其他相关群体(如宗教、国籍、性取向或残疾方面的少数群体)关注甚少。这主要由于缺少适用于此类群体的基准。我们旨在通过提供一个称为 MMBias 的视觉与文本偏见基准来弥补这一缺口,其包含约 3,800 张图像和短语,涵盖 14 个人口子群体。我们利用该数据集评估若干著名自监督多模态模型中的偏见,包括 CLIP、ALBEF 和 ViLT。我们的结果显示这些模型表现出偏向特定群体的显著偏见。最后,我们引入一种专为此类大型预训练模型设计的去偏方法,可作为后处理步骤应用以减轻偏见,同时保留模型其余精度。

关键词

引用

@article{arxiv.2303.12734,
  title  = {MultiModal Bias: Introducing a Framework for Stereotypical Bias Assessment beyond Gender and Race in Vision Language Models},
  author = {Sepehr Janghorbani and Gerard de Melo},
  journal= {arXiv preprint arXiv:2303.12734},
  year   = {2023}
}