中文

多模态大语言模型幻觉现象综述

计算机视觉与模式识别 2025-04-03 v2

摘要

本综述全面分析了多模态大语言模型(MLLMs)中出现的幻觉现象,亦称大型视觉语言模型(LVLMs),这些模型在多模态任务中展现出显著的进展和卓越能力。尽管有着这些有前景的发展,MLLMs 常常生成与视觉内容不一致的输出,这一挑战被称为幻觉,对其实际部署构成重大障碍,并引发对其在现实世界应用中可靠性的广泛关注。这一问题已引起日益关注,促使人们致力于检测和缓解此类不准确现象。我们审阅了近期在识别、评估和缓解这些幻觉方面的最新进展,提供了关于其背后原因、评估基准、指标以及为解决此问题而采取的策略的详尽概述。此外,我们分析了当前的挑战和局限性,提出开放性问题,以勾勒未来研究的潜在路径。通过对幻觉原因、评估基准和缓解方法进行细粒度分类和图景描绘,本综述旨在深化对 MLLMs 中幻觉现象的理解,并激发该领域的进一步发展。通过全面深入的审阅,我们为增强 MLLMs 的鲁棒性和可靠性提供了有价值的见解和资源,为研究人员和实践者提供支持。资源请访问:https://github.com/showlab/Awesome-MLLM-Hallucination。

关键词

引用

@article{arxiv.2404.18930,
  title  = {Hallucination of Multimodal Large Language Models: A Survey},
  author = {Zechen Bai and Pichao Wang and Tianjun Xiao and Tong He and Zongbo Han and Zheng Zhang and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2404.18930},
  year   = {2025}
}

备注

228 references