中文

基于推理时相关性传播缓解多模态大语言模型幻觉

机器学习 2026-05-05 v1 计算机视觉与模式识别 音频与语音处理

摘要

多模态大语言模型(MLLMs)已在 AI 领域取得突出成就,展现出在处理复杂视觉和音频语言任务方面的强大能力。然而,一个关键挑战仍然存在:这些模型常常会产生幻觉,生成与提供的感知输入不符的输出。这种倾向源于在推理过程中模态利用的内在不平衡,文本标记的主导地位削弱了感知输入的潜在价值。因此,模型经常会在不考虑依托证据的情况下诉诸文本语言先验。为解决此问题,我们提出学习推理时模态增强框架(LIME),这是一种无需训练的框架,旨在通过在解码过程中显著增强模态使用来强化多模态 grounding。LIME 利用图层相关性传播(LRP)来量化标记级别的贡献,并定义一种相关性基于的目标,以促进对感知输入的更大依赖。这种目标通过对模型的键值表示进行推理时更新来强制执行,既不修改模型参数,也不要求额外的训练数据。我们在视觉和音频领域的多个多模态基准测试上对 LIME 进行评估,展示了在保持生成质量的同时,幻觉显著减少,grounding 得到增强。进一步的分析显示,LIME 增加了模态贡献,产生更局部且在语义上与事实相符的相关性模式。

关键词

引用

@article{arxiv.2605.01766,
  title  = {Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time},
  author = {Itai Allouche and Joseph Keshet},
  journal= {arXiv preprint arXiv:2605.01766},
  year   = {2026}
}