通过反事实方法大规模探索大型视觉-语言模型中的偏见
计算机视觉与模式识别
2025-05-01 v2
摘要
随着大型语言模型(LLM)能力的不断提升,越来越多的大型视觉-语言模型(LVM)被提出用于将视觉输入纳入LLM。这些模型会根据输入图像和文本提示生成文本,实现视觉问答和多模态聊天等多种用例。虽然已有研究探讨了LLM生成文本中所包含的社会偏见,但在LVM中相关研究相对不足。考察LVM中的社会偏见尤为具有挑战性,因为社会偏见由文本和视觉模态中所包含信息的混合贡献。为解决这一挑战性问题,我们对不同LVM生成的文本进行大规模研究,通过对输入图像进行反事实变更,产生超过5700万条响应。我们的多维偏见评估框架揭示了图像中所表现的种族、性别和身体特征等社会属性,显著影响生成有毒内容、与能力相关的词汇、有害刻tic以及对个体的量化评分。
引用
@article{arxiv.2405.20152,
title = {Uncovering Bias in Large Vision-Language Models at Scale with Counterfactuals},
author = {Phillip Howard and Kathleen C. Fraser and Anahita Bhiwandiwalla and Svetlana Kiritchenko},
journal= {arXiv preprint arXiv:2405.20152},
year = {2025}
}
备注
Accepted to NAACL 2025 main track (oral)