观察、比较、决策:通过多视图多路径推理缓解大型视觉语言模型中的幻觉
计算机视觉与模式识别
2024-09-02 v1 人工智能
摘要
近期,大型视觉语言模型(LVLMs)在多模态上下文理解方面展现出了令人瞩目的能力。然而,它们仍然存在幻觉问题,即生成与图像内容不一致的输出。为了缓解幻觉,以往的研究主要集中在使用定制数据集重新训练 LVLMs。尽管有效,但这不可避免地带来了额外的计算成本。在本文中,我们提出了一个免训练框架 \textbf{MVP},旨在通过 \textbf{多}视图\textbf{多}路径\textbf{推}理(\textbf{M}ulti-\textbf{V}iew Multi-\textbf{P}ath Reasoning)充分利用 LVLMs 的内在能力来减少幻觉。具体而言,我们首先设计了一种多视图信息寻求策略,以全面感知图像中的综合信息,从而丰富了 LVLMs 中原始视觉编码器捕获的常规全局信息。此外,在答案解码过程中,我们观察到幻觉的出现与答案 token 的确定性密切相关。因此,我们针对每个信息视图提出多路径推理,以量化并聚合多个解码路径中每个潜在答案的确定性分数,并最终决定输出答案。通过充分掌握图像信息并在解码时仔细考虑潜在答案的确定性,我们的 MVP 能够有效减少 LVLMs 中的幻觉。大量实验验证了我们提出的 MVP 在四个知名 LVLMs 上显著缓解了幻觉问题。源代码可在 \url{https://github.com/GasolSun36/MVP} 获取。
引用
@article{arxiv.2408.17150,
title = {Look, Compare, Decide: Alleviating Hallucination in Large Vision-Language Models via Multi-View Multi-Path Reasoning},
author = {Xiaoye Qu and Jiashuo Sun and Wei Wei and Yu Cheng},
journal= {arXiv preprint arXiv:2408.17150},
year = {2024}
}
备注
13 pages, 7 tables, 7 figures