中文

通过反事实方法大规模探索大型视觉-语言模型中的偏见

计算机视觉与模式识别 2025-05-01 v2

摘要

随着大型语言模型(LLM)能力的不断提升,越来越多的大型视觉-语言模型(LVM)被提出用于将视觉输入纳入LLM。这些模型会根据输入图像和文本提示生成文本,实现视觉问答和多模态聊天等多种用例。虽然已有研究探讨了LLM生成文本中所包含的社会偏见,但在LVM中相关研究相对不足。考察LVM中的社会偏见尤为具有挑战性,因为社会偏见由文本和视觉模态中所包含信息的混合贡献。为解决这一挑战性问题,我们对不同LVM生成的文本进行大规模研究,通过对输入图像进行反事实变更,产生超过5700万条响应。我们的多维偏见评估框架揭示了图像中所表现的种族、性别和身体特征等社会属性,显著影响生成有毒内容、与能力相关的词汇、有害刻tic以及对个体的量化评分。

关键词

引用

@article{arxiv.2405.20152,
  title  = {Uncovering Bias in Large Vision-Language Models at Scale with Counterfactuals},
  author = {Phillip Howard and Kathleen C. Fraser and Anahita Bhiwandiwalla and Svetlana Kiritchenko},
  journal= {arXiv preprint arXiv:2405.20152},
  year   = {2025}
}

备注

Accepted to NAACL 2025 main track (oral)