中文

应用于顺序图像的多模态大语言模型行为幻觉消除

人工智能 2025-06-10 v1 计算与语言 计算机视觉与模式识别

摘要

虽然多模态大语言模型在各种任务中表现优异,但仍存在幻觉问题,这限制了其可靠性和可扩展性以适应更广泛的领域应用。 为了解决这一问题,近期研究主要关注客观幻觉。然而,对于顺序图像,除了客观幻觉之外,还存在行为幻觉,这一问题研究较少。 本工作旨在填补这一空白。 我们首先揭示,行为幻觉主要源自两个关键因素:先验驱动的偏差和雪球效应。基于这些观察,我们引入了 SHE(Sequence Hallucination Eradication),一个轻量级的两阶段框架:(1) 通过我们提出的自适应时序窗口进行视觉-文本对齐检查来检测幻觉;(2) 通过在联合嵌入空间上的正交投影来消除幻觉。我们还提出了一种新指标(BEACH)来量化行为幻觉的严重程度。在标准基准测试上的实证结果表明,SHE 在 BEACH 上将行为幻觉降低了超过 10%,同时保持了描述性准确性。

关键词

引用

@article{arxiv.2506.07184,
  title  = {Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images},
  author = {Liangliang You and Junchi Yao and Shu Yang and Guimin Hu and Lijie Hu and Di Wang},
  journal= {arXiv preprint arXiv:2506.07184},
  year   = {2025}
}