中文

理解并缓解多模态思维链模型中的幻觉问题

计算机视觉与模式识别 2026-03-31 v1

摘要

多模态思维链 (MCoT) 模型在复杂视觉推理任务中展现出令人印象深刻的能力。不幸的是,近期的研究揭示它们由于生成过程中视觉注意力的衰减而遭受严重的幻觉问题。然而,视觉注意力衰减是大型视觉语言模型 (LVLMs) 中一个已被广泛研究的问题。考虑到 MCoT 模型与传统 LVLMs 在推理过程上的根本差异,我们提出了一个基本问题:MCoT 模型是否具有独特的幻觉原因?为了回答这个问题,我们系统地调查了 MCoT 模型的幻觉模式,发现虚构文本主要在联想推理步骤中生成,我们称之为发散思维。利用这些见解,我们提出了一种简单而有效的策略,能够有效定位发散思维步骤并在解码过程中进行干预以缓解幻觉。大量实验表明,我们的方法以较大优势超越了现有方法。更重要的是,我们提出的方法可以方便地与其他幻觉缓解方法集成,进一步提升其性能。代码已公开发布于 https://github.com/ASGO-MM/MCoT-hallucination。

关键词

引用

@article{arxiv.2603.27201,
  title  = {Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models},
  author = {Ji Ma and Wei Suo and Peng Wang and Yanning Zhang},
  journal= {arXiv preprint arXiv:2603.27201},
  year   = {2026}
}

备注

CVPR 2026