像素推理器:基于好奇心驱动的强化学习激励像素空间推理
计算机视觉与模式识别
2025-10-27 v3 人工智能
计算与语言
摘要
链式思维推理显著提高了大语言模型在各个领域的性能。然而,这种推理过程一直局限于文本空间,限制了其在视觉密集型任务中的有效性。为此,我们提出了在像素空间进行推理的概念。,在这一新框架中,视觉语言模型 (VLM) 配备了一套视觉推理操作,如放大和选取帧。这些操作使 VLMs 能够直接检查、询问和从视觉证据中进行推断,从而提高了视觉任务的推理保真度。在 VLMs 中培育此类像素空间推理能力 presents notable 挑战,包括模型最初的能力不平衡以及其对新引入的像素空间操作的回避。我们通过两个阶段的训练来解决这些挑战。第一个阶段对合成的推理痕迹进行指令调校,以熟悉模型中新颖的视觉操作。随后,强化学习阶段利用好奇心驱动的奖励方案,在像素空间推理和文本推理之间实现探索的平衡。通过这些视觉操作,VLMs 可以与复杂的视觉输入(如信息丰富的图像或视频)交互,主动收集必要的信息。我们展示了这一方法在多样化视觉推理基准测试上的显著性能提升。我们的 7B 模型 \model 在 V* 基准测试上达到 84%,在 TallyQA-Complex 上达到 74%,在 InfographicsVQA 上达到 84%,创下了任何开源模型以来最高的准确率。这一结果凸显了像素空间推理的重要性以及我们框架的有效性。
引用
@article{arxiv.2505.15966,
title = {Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning},
author = {Haozhe Wang and Alex Su and Weiming Ren and Fangzhen Lin and Wenhu Chen},
journal= {arXiv preprint arXiv:2505.15966},
year = {2025}
}
备注
Project Page: https://tiger-ai-lab.github.io/Pixel-Reasoner/, Hands-on Demo: https://huggingface.co/spaces/TIGER-Lab/Pixel-Reasoner