穿透链条:通过 CoT 压缩和对比偏好优化缓解多模态推理模型中的幻觉
计算机视觉与模式识别
2026-04-03 v2
摘要
虽然多模态推理模型(MLRMs)已展现出惊人的能力,但仍容易产生幻觉,有效的解决方案仍受到忽视。在本文中,我们实验性地分析了幻觉成因,提出了 C3PO(Chain-of-Thought Compression 与 Contrastive Preference Optimization 的组合)以缓解幻觉的训练基框架。首先,我们识别到引入推理机制会加剧模型对语言先验的依赖,同时忽视视觉输入,这会产生视觉线索减少但冗余文本标记的 CoT。为此,我们提出 selectively 过滤冗余思考标记,以获得更紧凑且信号更高效的 CoT 表示,同时保留任务相关信息并抑制噪声。此外,我们观察到推理轨迹的质量很大程度上决定了后续响应是否出现幻觉。为利用这一洞见,我们引入推理增强的偏好调优方案,使用高质量 AI 反馈构建训练对。我们进一步设计了多模态幻觉诱导机制,通过仔细设计的诱导剂触发模型内在的幻觉模式,从而为对比纠正提供有信息的负面信号。我们对方法有效性提供了理论依据,并在多样化的 MLRM 和基准测试中Demonstrate 了一致的幻觉降低。
引用
@article{arxiv.2602.03380,
title = {Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization},
author = {Hao Fang and Jinyu Li and Jiawei Kong and Tianqu Zhuang and Kuofeng Gao and Bin Chen and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2602.03380},
year = {2026}
}