SPARC:分离感知与推理电路以实现视觉语言模型的测试时扩展
机器学习
2026-02-09 v1 计算机科学与博弈论
摘要
尽管近期取得了显著进展,但测试时扩展——即在推理过程中根据需要动态扩大 token 预算——对于视觉语言模型(VLMs)仍显脆弱:关于图像的非结构化链式思考导致感知与推理交织,产生冗长、杂乱的上下文,其中小的感知错误可能在完全错误的答案中扩散。此外,还需要昂贵的强化学习和精心设计的奖励才能获得良好性能。本文引入 SPARC(Separating Perception And Reasoning Circuits),一个模块化框架,显式地将视觉感知与推理解耦。灵感来自大脑的顺序感官到认知处理,SPARC 实现一个两阶段流程:模型首先执行显式的视觉搜索以局部化问题相关区域,然后将推理条件化于这些区域以生成最终答案。这种分离使独立的测试时扩展成为可能,可实现非对称的计算资源分配(例如,在分布迁移下优先处理感知环节),支持选择性优化(例如在感知环节是端到端性能瓶颈时单独改进感知阶段),并可通过在较低图像分辨率下运行全局搜索并仅对选定区域分配高分辨率处理来压缩上下文, 从而减少总体视觉 token 数量和计算开销。在各种具挑战性的视觉推理基准测试中,SPARC 超越了单一的基线和强大的视觉 grounding 方法。例如,SPARC 将 Qwen3VL-4B 在 VQA 基准测试上的准确率提高了6.7个百分点,在一个具有挑战性的 OOD 任务上超越“思考图像”4.6个百分点,同时只需原来的 200 倍 token 预算。
引用
@article{arxiv.2602.06565,
title = {Learning to Allocate Resources with Censored Feedback},
author = {Giovanni Montanari and Côme Fiegel and Corentin Pla and Aadirupa Saha and Vianney Perchet},
journal= {arXiv preprint arXiv:2602.06565},
year = {2026}
}