LVLMs语言偏差研究:从深度分析到简单有效的缓解方法
计算与语言
2026-05-26 v1 人工智能
摘要
大型视觉语言模型(LVLMs)将大型语言模型与视觉理解能力结合,但仍然容易产生幻觉现象,即输出流畅却与图像不一致。近期研究将这一问题与语言偏差相关——即LVLMs倾向于过度依赖文本而忽视视觉输入。然而,大多数分析仍停留在经验性,未能揭示其根本原因。本文对语言偏差进行系统性研究,识别其根源在于训练期间的模态错位。在分析中,我们发现视觉指令调谐(VIT)和直接偏好优化(DPO)常常优先改进文本,从而可能导致LVLMs过度依赖语言建模而非平衡的多模态理解。为此,我们提出两种简单且有效的方法:语言偏差正则化(LBR),通过在指令调谋期间的正则化来缓解语言偏差;以及语言偏差惩罚(LBP),在DPO训练过程中对语言偏差进行惩罚。广泛的实验表明,我们的方法有效。LBR在超过十个通用基准测试中 consistently 提升性能,而LBP显著减少幻觉并提高可信度。这些方法不仅缓解了语言偏差,也推动了LVLMs整体对齐,无需引入任何额外数据或辅助模型。我们的代码已公开于 https://github.com/lab-klc/LVLM-Language-Bias。
引用
@article{arxiv.2605.25036,
title = {Language Bias in LVLMs: From In-Depth Analysis to Simple and Effective Mitigation},
author = {Yangneng Chen and Jing Li},
journal= {arXiv preprint arXiv:2605.25036},
year = {2026}
}
备注
Accepted by ICML 2026