中文

基于信息流分析与多轮对话评估解释大型视觉语言模型中的社会偏见

人工智能 2025-05-28 v1

摘要

大型视觉语言模型(LVLM)在多模态任务中取得了显著进展,但也表现出明显的社会偏见。这些偏见通常表现为中性概念与敏感人类属性之间的非预期关联,导致模型在不同人口群体间表现出差异化的行为。现有研究主要集中在检测和量化此类偏见,但对模型内部潜在机制的洞察有限。为弥补这一不足,我们提出了一种结合信息流分析与多轮对话评估的解释性框架,旨在从不平衡的内部信息利用角度理解社会偏见的起源。具体而言,我们首先通过信息流分析识别出模型在处理中性问题时推理过程中具有高贡献的图像 token。然后,我们设计了一种多轮对话机制,以评估这些关键 token 编码敏感信息的程度。大量实验表明,LVLM 在处理不同人口群体的图像时,在信息使用上表现出系统性差异,这表明社会偏见深深根植于模型的内部推理动态中。此外,我们从文本模态角度补充了我们的发现,表明模型的语义表示已经显示出偏见的邻近模式,从而为偏见的形成提供了跨模态解释。

关键词

引用

@article{arxiv.2505.21106,
  title  = {Interpreting Social Bias in LVLMs via Information Flow Analysis and Multi-Round Dialogue Evaluation},
  author = {Zhengyang Ji and Yifan Jia and Shang Gao and Yutao Yue},
  journal= {arXiv preprint arXiv:2505.21106},
  year   = {2025}
}