中文

通过全局与局部注意力组装减轻大视觉语言模型中的对象幻觉

计算机视觉与模式识别 2025-03-17 v3 人工智能 计算与语言

摘要

尽管在各种多模态任务中取得了巨大成功,大型视觉语言模型(LVLMs)常常会遇到对象幻觉问题,生成的文本响应与图像中的实际对象不一致。我们检查了不同的LVLMs,并指出对象幻觉的一个根本原因在于对判别性图像特征注意力不足。具体而言,LVLMs往往主要关注提示无关的全局特征,而非提示相关的局部特征,从而削弱了其视觉定位能力并导致对象幻觉。我们提出了全局与局部注意力组装(Assembly of Global and Local Attention, AGLA),这是一种无训练且即插即用的方法,通过同时组装用于响应生成的全局特征和用于视觉判别的局部特征来缓解幻觉问题。具体做法是引入一种图像-提示匹配方案,从图像中捕获提示相关的局部特征,形成增强后的输入图像视图,其中突出显示提示相关内容,抑制无关干扰。因此,可以通过来自原始图像生成式全局特征和来自增强图像判别式局部特征校准的逻辑分布来缓解幻觉。大量实验表明,AGLA在LVLMs幻觉缓解方面表现优异,显示出在判别性和生成式任务中的广泛适用性。我们的代码已公开于https://github.com/Lackel/AGLA。

关键词

引用

@article{arxiv.2406.12718,
  title  = {Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention},
  author = {Wenbin An and Feng Tian and Sicong Leng and Jiahao Nie and Haonan Lin and QianYing Wang and Ping Chen and Xiaoqin Zhang and Shijian Lu},
  journal= {arXiv preprint arXiv:2406.12718},
  year   = {2025}
}

备注

Accepted by CVPR 2025