V-ITI: 通过视觉推理时干预缓解多模态大语言模型中的幻觉
计算机视觉与模式识别
2025-12-04 v1 人工智能
摘要
多模态大语言模型 (MLLM) 在诸多视觉语言任务中表现出色,但因产生与输入视觉不一致的内容而引发幻觉现象,这削弱了其在精密领域的可靠性。此问题源于视觉忽视的根本问题,即模型未能充分优先考虑输入图像。现有方法通常通过干预注意力得分或输出逻辑来缓解幻觉,关注“如何干预”,但忽略了“何时干预”的前提条件,这导致“过度干预”问题,随后引入新的幻觉并增加不必要的计算开销。为弥补这一差距,我们首先探讨了视觉忽视的机制并指出其可通过 MLLM 中的 head 级别激活模式准确检测。我们因此提出了 V-ITI,一种轻量级视觉推理时干预框架,集成了识别视觉忽略的视觉忽略检测器和仅在检测到视觉忽略时使用预存储视觉激活信息来调制激活的视觉记忆干预器。广泛的实验在八个基准测试和不同 MLLM 系列中表明,V-ITI 在保持一般任务性能的同时持续缓解视觉相关幻觉。
引用
@article{arxiv.2512.03542,
title = {V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention},
author = {Nan Sun and Zhenyu Zhang and Xixun Lin and Kun Wang and Yanmin Shang and Naibin Gu and Shuohuan Wang and Yu Sun and Hua Wu and Haifeng Wang and Yanan Cao},
journal= {arXiv preprint arXiv:2512.03542},
year = {2025}
}