通过门控感知-推理优化解决大型视觉语言模型的过度思考问题
计算机视觉与模式识别
2026-04-16 v2 计算与语言
摘要
大型视觉语言模型(LVLMs)通过生成逐步推理依据的思维链机制展现出了强大的推理能力。然而,这种慢思考方法通常会导致过度思考,即模型即使对于简单的查询也会产生过于冗长的回复,从而导致测试时效率低下甚至准确率下降。先前的工作试图通过自适应推理策略来缓解这一问题,但这些方法在很大程度上忽略了一个基本瓶颈:视觉感知失败。我们认为,稳定的推理严重依赖于低层视觉定位,且推理错误通常源于不完美的感知而非深思熟虑不足。为了解决这一局限性,我们提出了门控感知-推理优化(GPRO),这是一种元推理控制器,在每个生成步骤中动态地将计算路由到三条决策路径中:轻量级快速路径、用于重新检查视觉输入的慢速感知路径,以及用于内部自反思的慢速推理路径。为了学习这种区分,我们从约 79 万个样本中提取了大规模失败归因监督,使用教师模型来区分感知幻觉与推理错误。然后,我们使用多目标强化学习训练该控制器,以优化在不确定性下任务准确率与计算成本之间的权衡。在五个基准上的实验表明,GPRO 显著提高了准确率和效率,在生成更短回复的同时,优于近期的慢思考方法。
引用
@article{arxiv.2601.04442,
title = {Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization},
author = {Xingjian Diao and Zheyuan Liu and Chunhui Zhang and Weiyi Wu and Keyi Kong and Lin Shi and Kaize Ding and Soroush Vosoughi and Jiang Gui},
journal= {arXiv preprint arXiv:2601.04442},
year = {2026}
}
备注
Accepted to Annual Meeting of the Association for Computational Linguistics (ACL 2026)