通过图像锚定引导缓解大型视觉-语言模型中的物体幻觉
机器学习
2025-06-13 v2 人工智能
计算与语言
计算机视觉与模式识别
摘要
大型视觉-语言模型(LVLMs)的进步日益凸显了其倾向于在图像中幻觉出不存在的物体的关键问题。为了解决这个问题,先前的工作侧重于使用专门策划的数据集或强大的 LLM 来纠正 LVLMs 的输出。然而,这些方法要么需要昂贵的训练或微调,要么需要访问专有 LLM 的 API 以进行生成后校正。针对这些局限性,我们提出了通过图像锚定引导缓解幻觉(MARINE),这是一个无需训练且无需 API 的框架。MARINE 通过在推理过程中向 LVLMs 引入图像锚定引导,有效且高效地减少了物体幻觉。这是通过利用开源视觉模型提取物体级别的信息来实现的,从而提高了 LVLM 生成内容的精确度。我们框架的灵活性进一步允许集成多个视觉模型,从而实现更可靠、更稳健的物体级别引导。通过在 5 个流行的 LVLM 上使用多样化的评估指标和基准进行综合评估,我们证明了 MARINE 的有效性,其性能甚至优于现有的基于微调的方法。值得注意的是,它在 GPT-4V 辅助评估中持续减少了幻觉,同时保持了 LVLMs 生成的详细程度。我们在 https://github.com/Linxi-ZHAO/MARINE 发布了我们的代码。
引用
@article{arxiv.2402.08680,
title = {Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance},
author = {Linxi Zhao and Yihe Deng and Weitong Zhang and Quanquan Gu},
journal= {arXiv preprint arXiv:2402.08680},
year = {2025}
}
备注
25 pages, 13 figures, 25 tables