中文

知道答案不够:修复大型视觉语言模型中推理路径失效的方法

计算机视觉与模式识别 2025-12-09 v1

摘要

我们揭示了一个在大型视觉语言模型(LVLMs)中存在的关键且鲜有人关注的缺陷:即便这些模型知道正确答案,也经常通过错误的推理路径到达该结论。核心问题不在于知识缺失,而在于巨大的推理搜索空间中的路径选择偏差。尽管LVLMs通常能够采样出正确的解决方案轨迹,但却偏好选择不稳定或在逻辑上不一致的路径,导致结果不稳定且不可靠。大量模型中Pass@K(当K较大时)与Pass@1之间的显著差异,提供了强有力的证据表明,这类失效主要源于错误的推理而非无知。为系统性地研究和解决这一问题,我们提出了PSO(Path-Select Optimization),一个旨在增强现有LVLMs推理性能和稳定性的两阶段后训练框架。在第一个阶段,我们采用基于模板和答案的奖励机制,对组Relative Policy Optimization(GRPO)进行训练,以培育结构化、逐步推理的路径。在第二个阶段,我们进行在线偏好优化,模型从GRPO生成的数据中采样推理路径,自我评估这些路径,并对齐自身以偏好轨迹为导向。错误或次优路径同时存储在负回放记忆(NRM)中作为硬负样本,定期被重新访问,以防止模型重复犯错并促进持续的推理细化。大量实验表明,PSO有效地修剪了无效的推理路径,显著提升了推理准确性(平均提升7.4%),并产生更稳定、更一致的思考链。我们的代码将在 https://github.com/aiming-lab/PSO 上提供。

关键词

引用

@article{arxiv.2512.06258,
  title  = {Knowing the Answer Isn't Enough: Fixing Reasoning Path Failures in LVLMs},
  author = {Chaoyang Wang and Yangfan He and Yiyang Zhou and Yixuan Wang and Jiaqi Liu and Peng Xia and Zhengzhong Tu and Mohit Bansal and Huaxiu Yao},
  journal= {arXiv preprint arXiv:2512.06258},
  year   = {2025}
}