中文

HalluShift++:通过内部表示偏移桥接语言与视觉,用于多模态大语言模型中的分层幻觉

计算与语言 2025-12-09 v1 计算机视觉与模式识别

摘要

多模态大型语言模型(MLLM)在视觉-语言理解任务中展示了显著的能力。尽管这些模型通常产生语言连贯的输出,但它们经常遭受幻觉,生成与视觉内容事实不一致的描述,可能导致不良后果。因此,MLLM 中的幻觉评估在模型开发过程中变得越来越重要。当代方法主要依赖外部 LLM 评估器,这些评估器本身容易受到幻觉的影响,并且在领域适应方面可能面临挑战。在本研究中,我们提出假设:幻觉表现为 MLLM 内部层动力学中的可测量不规则性,不仅由于分布偏移,还在于特定假设的逐层分析语境。通过引入此类修改,HalluShift++ 将幻觉检测的有效性从基于文本的大型语言模型(LLM)扩展到涵盖多模态场景。我们的代码库位于 https://github.com/C0mRD/HalluShift_Plus。

关键词

引用

@article{arxiv.2512.07687,
  title  = {HalluShift++: Bridging Language and Vision through Internal Representation Shifts for Hierarchical Hallucinations in MLLMs},
  author = {Sujoy Nath and Arkaprabha Basu and Sharanya Dasgupta and Swagatam Das},
  journal= {arXiv preprint arXiv:2512.07687},
  year   = {2025}
}