LanP: 重新思考大型视觉语言模型中语言先验的影响
计算机视觉与模式识别
2025-02-19 v1
摘要
大型视觉语言模型(LVLMs)在各种任务中展现出惊人的性能,但因幻觉问题而受限于实际应用。现有研究强调LVLMs的强语言先验会压倒视觉信息,导致幻觉现象。然而,语言先验的积极作用是强大LVLMs的关键所在。若语言先验过于薄弱,LVLMs将难以利用丰富的参数知识和指令理解能力,在视觉信息不足以应对的挑战性视觉情境中完成任务。因此,我们提出了一个名为LanP的基准测试,用以重新思考LVLMs中语言先验的影响。该基准旨在考察当前LVLMs语言先验的强度。LanP包含170张图片和340个精心设计的提问。对25个流行LVLMs进行大规模实验表明,许多LVLMs的语言先验在对象部分遮挡时不足以有效辅助问答。包括GPT-4 Turbo在内的许多模型在此情境下的准确率低于0.5。
引用
@article{arxiv.2502.12359,
title = {LanP: Rethinking the Impact of Language Priors in Large Vision-Language Models},
author = {Zongyu Wu and Yuwei Niu and Hongcheng Gao and Minhua Lin and Zhiwei Zhang and Zhifang Zhang and Qi Shi and Yilong Wang and Sike Fu and Junjie Xu and Junjie Ao and Enyan Dai and Lei Feng and Xiang Zhang and Suhang Wang},
journal= {arXiv preprint arXiv:2502.12359},
year = {2025}
}
备注
Preprint