中文

推理至关重要:通过推理条件偏好优化缓解多模态大型推理模型中的幻觉

人工智能 2026-05-28 v1

摘要

多模态大型推理模型引入了推理范式,在复杂的视觉-语言任务上展现出强大的能力。然而,它们仍然存在严重的幻觉问题。现有的基于训练的方法通常通过响应级直接偏好优化(DPO)来缓解幻觉,其中思维链(CoT)和最终答案被视为一个整体输出并进行联合优化。我们揭示出这种公式化方法的表现与仅优化答案的方法相似,表明它主要学习答案级别的偏好,而未能充分利用CoT级别的监督。为解决此问题,我们明确地构建了一个面向CoT的偏好项,并推导出推理条件直接偏好优化(RC-DPO),该方法将CoT建模为答案生成的条件,并在不同CoT条件下对比同一偏好答案的偏好,从而促进支持答案的推理链对齐。为进一步改进优化,我们引入了一种推理增强的偏好数据生成策略,该策略采用蒙特卡洛树搜索来发现视觉上可验证且逻辑一致的CoT作为正样本,并采用注意力引导的CoT令牌剪枝来构建负样本。跨多种模型和基准的大量实验表明,RC-DPO有效缓解了幻觉,并提高了多模态推理过程的可靠性。

关键词

引用

@article{arxiv.2605.27906,
  title  = {Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization},
  author = {Jiawei Kong and Hao Fang and Shunxiang Liao and Jinyu Li and Bin Chen and Hao Wu and Shu-Tao Xia and Min Zhang},
  journal= {arXiv preprint arXiv:2605.27906},
  year   = {2026}
}