中文

基于理由增强的多模态链式思维解码

计算机视觉与模式识别 2026-03-17 v2 人工智能 机器学习

摘要

大型视觉语言模型 (LVMM) 通过将预训练视觉编码器与大型语言模型 (LLM) 集成 demonstrating 了显著的能力。类似地,链式思维 (CoT) 提示已被适用于 LVMM 以通过生成基于视觉和文本输入的中间理由来增强多模态推理。尽管假设 CoT 能提高 LVMM 中的 grounding 和准确性,但我们的实验揭示了一个关键挑战:现有的 LVMM 常常忽略在 CoT 推理中生成的理由内容。为此,我们将多模态 CoT 推理重新表述为基于理由条件对数似然的 KL 约束奖励最大化。作为最优解,我们提出了理由增强解码 (RED),一种新的即插即用推理时间解码策略。RED 通过乘以不同的图像条件分布和理由条件分布来调和视觉信息和理由信息。广泛的实验表明,RED 在多个基准和 LVMM 上 consistently and significantly improves reasoning over standard CoT and other decoding methods.我们的工作提供了一种实用且有效的方法来提高 CoT 推理在 LVMM 中的忠实性和准确性,为可靠的理由导向多模态系统铺路。代码可在 https://github.com/yshinya6/red/ 获取。

关键词

引用

@article{arxiv.2507.07685,
  title  = {Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought},
  author = {Shin'ya Yamaguchi and Kosuke Nishida and Daiki Chijiwa},
  journal= {arXiv preprint arXiv:2507.07685},
  year   = {2026}
}

备注

Accepted to CVPR 2026 (Main); Code is available at https://github.com/yshinya6/red/