PatchCue:通过基于块的视觉线索增强视觉语言模型的推理
计算机视觉与模式识别
2026-03-16 v2
摘要
视觉语言模型 (Vision-Language Models, VLMs) 在广泛的多模态理解和推理任务中取得了显著进展。然而,现有的推理范式(如经典的链式思考 Chain-of-Thought, CoT)仅依赖文本信息,往往未充分利用重要的视觉线索。虽然已有工作将像素级视觉线索纳入考虑,但这些表征需要精确的空间局部分辨,引入了额外的学习复杂度。为此,我们提出了 PatchCue,一种新颖的基于块的视觉线索范式,旨在显著增强视觉语言模型的视觉推理能力。通过将图像划分为块,并在块级别表示线索,PatchCue 更符合人类感知习惯,同时利用现代视觉语言模型的块级分词输入。我们采用两阶段方法进行训练:首先进行冷启动监督微调以输出块级线索,然后通过基于过程监督的线索奖励进行强化学习,以指导中间视觉推理步骤。在多个视觉语言模型和多样化基准测试上进行了大量实验,包括常规视觉问答、复杂推理和文档理解,结果表明 PatchCue 在整体模型性能上 consistently 提供改进。我们的結果显示,块级线索优于像素级边界框和基于点的线索,提供了更有效且更符合认知的视觉推理范式。
引用
@article{arxiv.2603.05869,
title = {PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues},
author = {Yukun Qi and Pei Fu and Hang Li and Yuhan Liu and Chao Jiang and Bin Qin and Zhenbo Luo and Jian Luan},
journal= {arXiv preprint arXiv:2603.05869},
year = {2026}
}