中文

ClueTracer:面向多模态推理中无训练幻觉抑制的问到视觉线索追踪

计算机视觉与模式识别 2026-02-03 v1 人工智能

摘要

大型多模态推理模型通过显式的长链推理解决复杂视觉问题:它们从图像中收集视觉线索,并将线索解码为文本 token。然而,这一能力也会导致幻觉现象——模型生成的内容不受输入图像或问题的支持。为理解这一失效模式,我们识别出\emph{推理漂移}:在线索收集过程中,模型过度聚焦于与问题无关的实体,稀释了对任务相关线索的注意力,进而逐渐使推理轨迹与视觉 grounding 脱节。作为结果,许多针对非推理模型的推理时定位或干预方法,难以在推理场景中精准定位真实线索。鉴于这些洞察,我们引入 ClueRecall,用于评估视觉线索检索的指标,并提出 ClueTracer,一种无需训练、无需参数、且与模型架构无关的插件,用于幻觉抑制。ClueTracer 从问题开始,沿模型的推理路径(问题 \rightarrow 输出 \rightarrow 视觉 token)追踪关键线索如何传播,从而局部化任务相关的 patch,同时抑制对无关区域的注意力。令人惊讶的是,在\textbf{无需任何额外训练}的情况下,ClueTracer 对所有\textbf{推理}架构(包括 \texttt{R1-OneVision}、\texttt{Ocean-R1}、\texttt{MM-Eureka} 等)均实现 1.21×\mathbf{1.21\times} 的提升。当迁移到\textbf{非推理}场景时,亦可获得 1.14×\mathbf{1.14\times} 的增益。

关键词

引用

@article{arxiv.2602.02004,
  title  = {ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning},
  author = {Gongli Xi and Kun Wang and Zeming Gao and Huahui Yi and Haolang Lu and Ye Tian and Wendong Wang},
  journal= {arXiv preprint arXiv:2602.02004},
  year   = {2026}
}

备注

20 pages, 7 figures