大型视觉语言模型幻觉现象综述
人工智能
2024-10-22 v1
摘要
大型视觉语言模型(LVLMs)在大型语言模型(LLMs)的基础上集成了视觉模态,显著提升了用户交互并丰富了用户体验,展示出强大的信息处理和生成能力。然而,幻觉现象的存在限制了LVLMs在各个领域的潜力和实际有效性。尽管大量工作致力于幻觉缓解与纠正,但目前缺乏对该议题的综述性总结。本综述首先介绍LVLMs与幻觉的背景。随后,介绍LVLMs的结构及幻觉产生的主要原因。进一步地,总结近期在幻觉纠正与缓解方面的研究成果。此外,本文从判断性和生成性视角呈现可用的幻觉评估基准。最后,提出一些未来研究方向,以增强LVLMs的可靠性和实用性。
引用
@article{arxiv.2410.15359,
title = {A Survey of Hallucination in Large Visual Language Models},
author = {Wei Lan and Wenyi Chen and Qingfeng Chen and Shirui Pan and Huiyu Zhou and Yi Pan},
journal= {arXiv preprint arXiv:2410.15359},
year = {2024}
}