大语言模型与视觉模型幻觉现象理解综述
计算机视觉与模式识别
2025-10-02 v1 人工智能
摘要
大语言模型和视觉模型在实际应用中的广泛采用,使得迫切需要解决幻觉问题——即模型产生错误或毫无意义输出的情形。这些错误可能在部署期间导致信息误传,造成财务和运营损失。尽管已有大量研究致力于缓解幻觉问题,但我们对其理解仍不完整且碎片化。在缺乏连贯理解的情况下,所提出的解决方案风险是缓解表层症状而非根本原因,限制了其有效性和可移植性。为克服这一局限,我们首先提出了一个统一的、多层次的框架,用于概括不同应用场景下的图像和文本幻觉,以减少概念碎片化。随后,我们采用任务-模态交叉的方法将这些幻觉与模型生命周期中的特定机制关联起来,以促进更集成的理解。我们的调查结果表明,幻觉往往源于数据分布和继承偏见中的可预测模式。通过深化对幻觉的理解,本综述为开发更稳健、更有效的解决方案奠定了基础,这些解决方案可应用于实际生成式AI系统。
引用
@article{arxiv.2510.00034,
title = {Review of Hallucination Understanding in Large Language and Vision Models},
author = {Zhengyi Ho and Siyuan Liang and Dacheng Tao},
journal= {arXiv preprint arXiv:2510.00034},
year = {2025}
}