饥饿以感知:利用受限视觉带宽驯服 VLM 中的惰性感知
计算机视觉与模式识别
2026-05-19 v1
摘要
作为部署在高分辨率视觉环境中的具身智能体,视觉语言模型(Vision-Language Models, VLMs)需要主动感知——即通过缩放、裁剪和平移等操作动态决定观察位置的能力。然而,当前的训练范式使得模型仅模仿此类操作的表面形式,而未在功能上依赖于其输出,我们将这一现象称为惰性感知。我们将其追溯至一种根本的学习不对称性:当粗略的全局视图结合语言先验足以达到中等准确率时,模型便没有动机去学习更困难的多步视觉搜索。如果一个模型无需主动观察即可成功,它将永远学不会去观察。这促使我们提出 Starve to Perceive,一种限制视觉带宽的训练范式——将每次观察限制在紧凑的 token 预算内,使得没有任何单一视图足以完成任务,从而令主动感知成为唯一可行的策略。尽管不需要辅助损失、奖励塑形或架构更改——作为标准后训练管线的极简即插即用修改——在感知饥饿下训练的模型在多样化基准上实现了 5% 平均相对提升的显著增益。
引用
@article{arxiv.2605.18603,
title = {Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth},
author = {Yuhuan Wu and Cong Wei and Fangzhen Lin and Wenhu Chen and Haozhe Wang},
journal= {arXiv preprint arXiv:2605.18603},
year = {2026}
}