中文

图像胜于语言:从因果中介视角理解与缓解视觉语言模型中的偏见

人工智能 2025-06-09 v3 计算与语言 计算机视觉与模式识别

摘要

视觉语言模型(VLMs)在大规模数据集上预训练后可能不慎学习到偏见,这些偏见通过性别信息与特定物体或情景之间的相关性来体现。当前方法侧重于修改输入并监控模型输出概率分数的变化,往往难以从模型组件的角度全面理解偏见。我们提出一种框架,将因果中介分析纳入其中,以衡量和描绘VLIs内部偏见生成与传播的路径。该方法允许我们识别对模型偏见的干预的直接效应,以及通过不同模型组件中介的干预对偏见的间接效应。我们的结果表明,图像特征是偏见的主要贡献者,其影响显著高于文本特征,分别在MSCOCO和PASCAL-SENTENCE数据集中占比32.57%和12.63%。值得注意的是,图像编码器的贡献超过了文本编码器和深度融合编码器。进一步的实验确认,语言和视觉模态的贡献是一致的且不冲突的。因此,聚焦于模糊图像编码器中性别表征,这是对模型偏见贡献最大的部分,可通过22.03%和9.04%(分别在MSCOCO和PASCAL-SENTENCE数据集中)有效地减少偏见,而对性能几乎没有损失或增加计算需求。

关键词

引用

@article{arxiv.2407.02814,
  title  = {Images Speak Louder than Words: Understanding and Mitigating Bias in Vision-Language Model from a Causal Mediation Perspective},
  author = {Zhaotian Weng and Zijun Gao and Jerone Andrews and Jieyu Zhao},
  journal= {arXiv preprint arXiv:2407.02814},
  year   = {2025}
}