超越文本:通过多模态双注意和软图像引导降低大型视觉语言模型中的语言偏见
计算机视觉与模式识别
2026-05-29 v2 计算与语言
摘要
大型视觉语言模型 (LVMM) 在 various vision-language tasks 上取得了令人印象深刻的成绩。然而,尽管性能前景广阔, LVMM 仍因语言偏见导致幻觉现象,严重影响图像关注度并降低视觉理解效果。我们确定了这种偏见的两个主要原因: 1. 大语言模型预训练阶段与多模态对齐阶段训练数据的规模差异; 2. 由于文本数据的短期依赖性, 导致推理偏见的学习。因此, 我们提出了 LACING, 一个系统性框架, 旨在通过多模态双注意机制 (MDA) 和软图像引导 (IFG) 来解决 LVMM 的语言偏见问题。具体而言, MDA 引入平行双注意力机制, 以增强模型中视觉输入的集成。IFG 在训练和推理过程中引入可学习的软视觉提示, 以取代视觉输入, 旨在迫使 LVMM 更加关注文本输入。随后, IFG 提出一种新颖的解码策略, 使用软视觉提示来缓解模型对相邻文本输入的过度依赖。通过大量实验验证, 我们的方法有效地消除了 LVMM 的语言偏见, 提升了视觉理解能力并减少了幻觉现象, 且无需额外的训练资源或数据。该项目代码已公开: https://lacing-lvlm.github.io。
引用
@article{arxiv.2411.14279,
title = {Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance},
author = {Haozhe Zhao and Shuzheng Si and Liang Chen and Yichi Zhang and Maosong Sun and Mingjia Zhang and Baobao Chang},
journal= {arXiv preprint arXiv:2411.14279},
year = {2026}
}
备注
EMNLP 2025