执行零样本任务的视觉-语言模型表现出基于性别的差异
计算机视觉与模式识别
2023-01-27 v1 计算机与社会
人机交互
摘要
我们探究零样本视觉-语言模型在不同视觉任务中表现出性别偏见的程度。视觉模型传统上需要特定于任务的标签来表示概念并进行微调;而像CLIP这样的零样本模型借助文本嵌入表示概念,以开放词表执行任务,即无需固定标签集。考虑到这些能力,我们提问:视觉-语言模型在执行零样本图像分类、目标检测与语义分割时是否表现出性别偏见?我们使用多个数据集在不同概念上评估多种视觉-语言模型,发现(i)所有被评估模型均基于图像中与给定概念共现人物的感知性别表现出明显的性能差异,且对所有概念汇总分析会掩盖这些问题;(ii)模型校准(即准确率与置信度间关系)也随感知性别明显不同,即便在相似概念表征上评估时亦然;(iii)这些观察到的差异与语言模型词嵌入中已有的性别偏见一致。这些发现表明,尽管语言极大扩展了视觉任务的能力,也可能在零样本视觉场景中助长社会偏见。此外,当CLIP等基础模型被其他模型用于实现零样本能力时,偏见会进一步传播。
引用
@article{arxiv.2301.11100,
title = {Vision-Language Models Performing Zero-Shot Tasks Exhibit Gender-based Disparities},
author = {Melissa Hall and Laura Gustafson and Aaron Adcock and Ishan Misra and Candace Ross},
journal= {arXiv preprint arXiv:2301.11100},
year = {2023}
}