中文

有偏注意力:视觉Transformer比卷积神经网络更易放大性别偏见吗?

计算机视觉与模式识别 2023-09-19 v1

摘要

计算机视觉中使用的深度神经网络已被证明表现出许多社会偏见,例如性别偏见。Vision Transformers (ViTs) 在计算机视觉应用中日益流行,在图像分类等许多任务中表现优于 Convolutional Neural Networks (CNNs)。然而,鉴于计算机视觉中缓解偏见的研究主要集中于 CNNs,评估不同网络架构对偏见放大潜力的影晌十分重要。因此,本文引入了一种衡量架构中偏见的新指标——准确率差异(Accuracy Difference)。我们考察了当属于这两种架构的模型作为大型多模态模型的一部分使用时所产生的偏见放大现象,评估了 Contrastive Language Image Pretraining(CLIP)的不同图像编码器,该模型是 DALL-E 和 Stable Diffusion 等许多生成模型中的重要模型。我们的实验表明,由于模型在特征提取与嵌入方面采用的不同技术及其不同的学习特性,架构可能在放大社会偏见中发挥作用。本研究发现,ViTs 比 CNNs 更大程度上放大了性别偏见。

关键词

引用

@article{arxiv.2309.08760,
  title  = {Biased Attention: Do Vision Transformers Amplify Gender Bias More than Convolutional Neural Networks?},
  author = {Abhishek Mandal and Susan Leavy and Suzanne Little},
  journal= {arXiv preprint arXiv:2309.08760},
  year   = {2023}
}