少看多思考:基于滚动驱动的自适应像素空间推理
计算机视觉与模式识别
2025-10-03 v1 人工智能
摘要
视觉语言模型(VLM)在众多多模态任务中表现出色,但常在需要精确理解和处理细粒度视觉元素的任务上表现不佳。这主要源于图像编码过程中的信息损失或对关键区域注意力不足。最近的研究通过将像素级视觉信息纳入推理过程,使 VLM 能够在思考过程中访问高分辨率视觉细节,显示出前景。然而,这些像素级信息常被过度使用,导致效率低下且分散注意力于无关视觉细节。为应对这些挑战,我们提出首个自适应像素推理框架,基于输入查询动态确定必要的像素级操作。具体而言,我们首先应用操作感知的监督式微调,以建立文本推理和视觉操作的基线能力,然后设计一种新型的滚动驱动强化学习框架,依据模型自身响应的反馈,使 VLM 能够根据查询难度决定何时调用像素操作。在广泛的多模态推理基准测试上,我们的模型实现了卓越的性能,同时显著减少了不必要的视觉操作。令人印象深刻的是,我们的模型在 HR-Bench 4K 上实现了 73.4% 的准确率,仅使用 20.1% 的工具调用比率,较先前方法在准确率提升 66.5% 的同时,工具使用量显著降低。
引用
@article{arxiv.2510.01681,
title = {Look Less, Reason More: Rollout-Guided Adaptive Pixel-Space Reasoning},
author = {Xuchen Li and Xuzhao Li and Jiahui Gao and Renjie Pi and Shiyu Hu and Wentao Zhang},
journal= {arXiv preprint arXiv:2510.01681},
year = {2025}
}
备注
Preprint, Under review