利用反事实揭示大型视觉-语言模型中的偏见
计算机视觉与模式识别
2024-06-11 v2 人工智能
摘要
随着大型语言模型(LLM)能力日益增强,许多大型视觉-语言模型(LVLM)被提出以增强LLM的视觉输入。这些模型根据输入图像和文本提示生成文本,支持视觉问答和多模态聊天等多种应用。虽然先前研究检查了LLM生成文本中的社会偏见,但这一主题在LVLM中相对未被探索。检查LVLM中的社会偏见尤其具有挑战性,因为文本和视觉模态信息所引发的偏见相互混杂。为解决这一难题,我们对不同LVLM在输入图像反事实变化下生成的文本进行了大规模研究。具体而言,我们向LVLM提供相同的开放式文本提示,同时基于来自不同反事实集的图像进行条件生成,每个集合中的图像在描绘共同主体(如医生)方面大致相同,但仅在交叉社会属性(如种族和性别)上有所不同。我们全面评估了不同LVLM在这种反事实生成设置下产生的文本,发现输入图像中描绘的社会属性(如种族、性别和身体特征)会显著影响毒性以及能力相关词汇的生成。
引用
@article{arxiv.2404.00166,
title = {Uncovering Bias in Large Vision-Language Models with Counterfactuals},
author = {Phillip Howard and Anahita Bhiwandiwalla and Kathleen C. Fraser and Svetlana Kiritchenko},
journal= {arXiv preprint arXiv:2404.00166},
year = {2024}
}
备注
Accepted to the CVPR 2024 Responsible Generative AI (ReGenAI) Workshop