VLM-FO1:弥合视觉语言模型中高级推理与细粒度感知之间的差距
计算机视觉与模式识别
2025-10-01 v1 计算与语言
摘要
视觉语言模型擅长高级场景理解,但在需要精确定位的细粒度感知任务上表现不佳。这种失败源于一个根本性的不匹配,因为生成精确的数值坐标对于以语言为中心的架构来说是一项具有挑战性的任务。在本文中,我们引入了 VLM-FO1,这是一个新颖的框架,通过将以对象为中心的感知从一个脆弱的坐标生成问题重新转化为一个稳健的特征检索任务,从而克服了这一局限性。我们的方法作为一个即插即用模块运行,可与任何预训练的 VLM 集成。它利用混合细粒度区域编码器,该编码器具有双视觉编码器,以生成富含语义和空间细节的强大区域 token。随后,基于 token 的引用系统使 LLM 能够在这些特定的视觉区域中无缝地进行推理并实现语言落地。实验表明,VLM-FO1 在多种基准测试中均取得了 SOTA 性能,在对象定位、区域生成理解以及视觉区域推理方面展现出卓越的能力。至关重要的是,我们的两阶段训练策略确保了在不损害基础模型通用视觉理解能力的情况下实现这些感知增益。VLM-FO1 为构建感知感知的 VLM 建立了一个有效且灵活的范式,弥合了高级推理与细粒度视觉定位之间的差距。
引用
@article{arxiv.2509.25916,
title = {VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs},
author = {Peng Liu and Haozhan Shen and Chunxin Fang and Zhicheng Sun and Jiajia Liao and Tiancheng Zhao},
journal= {arXiv preprint arXiv:2509.25916},
year = {2025}
}
备注
22 pages