何时思考,何时观察:基于不确定性的回溯机制
计算机视觉与模式识别
2026-03-30 v3 计算与语言
摘要
测试时思考(即生成明确的中间推理链)已知可提升大型语言模型的性能,最近也显示出对大型视觉语言模型(LVLMs)取得显著提升。然而,尽管已有令人鼓舞的结果,如何实际影响视觉推理仍缺乏系统性分析。我们提供首个此类分析,基于大规模、受控的比较,对LVLMs的思考进行评估,在MMMl-val上评估十种变体(来自InternVL3.5和Qwen3-VL系列),在充足的token预算和多轮解码下进行。我们发现,更多的思考并不总是更好;长链常常导致错误的推理路径,忽视图像输入,性能甚至不如标准指令模式下的同类模型。更深入的分析揭示,某些简短的回溯短语(显式指向图像)在成功的推理轨迹中高度频繁,且与更好的视觉定位相关。基于此洞见,我们提出一种基于不确定性的回溯机制,一种无需训练的解码策略,结合不确定性信号、自适应回溯提示和宽度搜索。我们的方法在提升整体MMMl性能方面有效,在标准思考表现薄弱的类别中取得最大提升,并超越多个强大的解码基线,在固定模型家族和token预算下树立新纪录。我们进一步展示了该解码策略的可迁移性,在五个额外基准(包括两个宽泛的多模态套件和数学导向的视觉推理数据集)上均实现一致的改进。
引用
@article{arxiv.2511.15613,
title = {When to Think and When to Look: Uncertainty-Guided Lookback},
author = {Jing Bi and Filippos Bellos and Junjia Guo and Yayuan Li and Chao Huang and Yolo Y. Tang and Luchuan Song and Susan Liang and Zhongfei Mark Zhang and Jason J. Corso and Chenliang Xu},
journal= {arXiv preprint arXiv:2511.15613},
year = {2026}
}
备注
Accepted to CVPR 2026