Foveated Reasoning:面向视觉语言模型的有状态、基于动作的视觉聚焦
计算机视觉与模式识别
2026-04-24 v1
摘要
视觉语言模型受益于高分辨率图像,但图像中视觉 token 数量的增加导致计算开销高昂。人类通过 foveation(视觉聚焦)来解决这一矛盾:粗略视图引导“该看何处”,而 selectively acquired 的高细节证据细化“该思考何处”。我们提出 Foveated Reasoner(聚焦式推理者),一个自回归视觉语言框架,将 foveation 与 reasoning 统一于单一解码轨迹中。从低分辨率视图开始,仅在必要时触发 foveation,从选中区域检索高分辨率证据,并将其注入相同的解码轨迹。我们采用两阶段训练流程:coldstart 监督以引导 foveation 行为,随后使用强化学习联合优化证据获取与任务准确性,同时抑制平凡的“遍览”解ategy。实验表明,该方法学习到有效的 foveation 策略,在多个视觉语言基准测试中,在受限视觉 token 预算下实现更高准确率。
关键词
引用
@article{arxiv.2604.21079,
title = {Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models},
author = {Juhong Min and Lazar Valkov and Vitali Petsiuk and Hossein Souri and Deen Dayal Mohan},
journal= {arXiv preprint arXiv:2604.21079},
year = {2026}
}