关注图像:一种无需训练的 alleviating LVLMs 幻觉方法
计算机视觉与模式识别
2024-08-01 v1
摘要
现有的大型视觉语言模型(LVLMs)主要通过对齐视觉编码器的图像特征与大型语言模型(LLMs)的特征来实现,从而利用其卓越的文本生成能力。然而,视觉编码器与语言模型之间的规模差异可能导致 LLMs 在多模态理解中发挥主导作用。这种不平衡的 LVLMs 可能导致幻觉现象。具体而言,LVLMs 可能在有或没有视觉输入时生成一致的描述,表明某些输出仅受上下文文本的影响。我们称这种现象为“文本惯性”。为抵消此问题,我们引入一种无需训练的算法,以寻找图像理解与语言推断之间的平衡点。具体来说,我们自适应地调整并放大分配给图像标记的注意力权重,从而赋予视觉元素更大的重要性。同时,我们从多模态输入的 logits 中减去纯文本输入的 logits,这可以帮助 LVLMs 不偏向于 LLMs。通过增强图像标记并减少 LLM 的顽固输出,我们可以让 LVLMs 更关注图像,从而减轻文本惯性并减少 LVLMs 中的幻觉。我们进行了大量实验,表明该方法在不同指标下显著减少了各种 LVLMs 中幻觉输出的频率。项目页面可在 https://lalbj.github.io/projects/PAI/ 查看。
引用
@article{arxiv.2407.21771,
title = {Paying More Attention to Image: A Training-Free Method for Alleviating Hallucination in LVLMs},
author = {Shi Liu and Kecheng Zheng and Wei Chen},
journal= {arXiv preprint arXiv:2407.21771},
year = {2024}
}