中文

大型视觉语言模型中的幻觉综述

计算机视觉与模式识别 2024-05-07 v2 计算与语言 机器学习

摘要

近期,大型视觉语言模型(LVLMs)的发展因其实际应用潜力而在人工智能领域引起了越来越多的关注。然而,“幻觉”——更具体地说,事实视觉内容与相应文本生成之间的不一致——构成了利用 LVLMs 的一项重大挑战。在这篇全面的综述中,我们剖析了与 LVLM 相关的幻觉,旨在建立整体概述并促进未来的缓解研究。我们的审查首先澄清了 LVLMs 中幻觉的概念,展示了多种幻觉症状,并强调了 LVLM 幻觉固有的独特挑战。随后,我们概述了专门针对评估 LVLMs 独有幻觉而量身定制的基准和方法。此外,我们深入调查了这些幻觉的根本原因,涵盖了来自训练数据和模型组件的见解。我们还批判性地回顾了现有的缓解幻觉的方法。最后,讨论了与 LVLMs 幻觉相关的开放性问题和未来方向,以此作为本综述的总结。

关键词

引用

@article{arxiv.2402.00253,
  title  = {A Survey on Hallucination in Large Vision-Language Models},
  author = {Hanchao Liu and Wenyuan Xue and Yifei Chen and Dapeng Chen and Xiutian Zhao and Ke Wang and Liping Hou and Rongjun Li and Wei Peng},
  journal= {arXiv preprint arXiv:2402.00253},
  year   = {2024}
}