中文

通过主动检索增强缓解大型视觉语言模型中的幻觉现象

计算机视觉与模式识别 2024-08-02 v1 人工智能 计算与语言

摘要

尽管大型视觉语言模型(Large Vision-Language Models, LVLMs)在图像理解方面表现突出,但这些模型经常会生成看似合理却事实错误的响应,称为幻觉(hallucination)。最近,在大型语言模型(Large Language Models, LLMs)中,通过从外部知识资源检索信息来增强LLMs已被证明是缓解幻觉的有前景的解决方案。然而,LVLM上的检索增强显著落后于LVLMs的广泛应用。此外,当将检索增强移植到LVLMs时,模型的幻觉程度有时甚至会加剧。针对这一研究空白和反直觉现象,我们引入了一种新型框架——主动检索增强大型视觉语言模型(Active Retrieval-Augmented large vision-language model, ARA),专为通过纳入三个关键维度来解决幻觉问题而设计:(i) 基于图像固有的层次结构解构检索目标;(ii) 确定最有效的检索方法并过滤可靠的检索结果;(iii) 在确定性较低的时段触发检索,而在确定性较高的时段规避不必要的检索。为评估我们所提出ARA模型在减少幻觉方面的能力,我们采用四个广泛使用的LVLM模型(Llava-1.5、Qwen-VL和mPLUG-Owl2)进行实验。我们的经验观察表明,通过采用合适的检索机制并恰当地安排检索时机,我们可以有效缓解幻觉问题。我们希望本研究能为如何以更有效且最小化检索次数的方式将检索增强应用于LVLMs以减少幻觉提供更深入的见解。

关键词

引用

@article{arxiv.2408.00555,
  title  = {Alleviating Hallucination in Large Vision-Language Models with Active Retrieval Augmentation},
  author = {Xiaoye Qu and Qiyuan Chen and Wei Wei and Jishuo Sun and Jianfeng Dong},
  journal= {arXiv preprint arXiv:2408.00555},
  year   = {2024}
}