VisBias: 测量视觉语言模型中的显式和隐式社会偏见
计算机视觉与模式识别
2025-09-09 v3 计算与语言
摘要
本研究探讨了视觉语言模型(VLM)所表现的显式和隐式社会偏见。这些偏见类型的关键区别在于意识水平:显式偏见指有意识的、有意的偏见,而隐式偏见则在潜意识下运作。为分析显式偏见,我们直接提问与性别和种族差异相关的VLMs问题:(1) 基于给定图像的多选问答(例如,"图像中人的教育程度是?");(2) 使用两个图像的是-否比较(例如,"图像中第一个人的教育程度是否高于第二个人的?")。对于隐式偏见,我们设计任务让VLMs帮助用户,但通过其响应揭示偏见:(1) 图像描述任务:要求模型描述图像中的个体,我们分析不同人口统计学群体在文本线索之间的差异;(2) 表单完成任务:模型草拟一个收集个人信息的表格包含20个属性,我们检查所选属性之间的相关性以识别潜在偏见。我们评估了 Gemini-1.5、GPT-4V、GPT-4o、LLaMA-3.2-Vision 和 LLaVA-v1.6。我们的代码和数据已公开于 https://github.com/uscnlp-lime/VisBias。
引用
@article{arxiv.2503.07575,
title = {VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models},
author = {Jen-tse Huang and Jiantong Qin and Jianping Zhang and Youliang Yuan and Wenxuan Wang and Jieyu Zhao},
journal= {arXiv preprint arXiv:2503.07575},
year = {2025}
}
备注
Accepted to EMNLP 2025 (Main)