GeoWeaver:在场景推理前以几何证据对视觉标记进行 grounding
计算机视觉与模式识别
2026-05-22 v1
摘要
视觉-语言模型中的时空推理需要保留物理几何结构的视觉表示,而不仅仅是语义外观。最近的多模态模型通过结构分支、3D aware 监督、推理阶段融合或长期记忆等方式将几何信息纳入模型。虽然这些方法都表明了几何信息对空间智能的重要性,但它们通常将几何线索作为所有视觉标记共享的信号。我们注意到,这忽略了一个更细致的挑战:不同的视觉标记根据其空间角色需要不同的几何证据。为此,我们提出了 GeoWeaver,一种在场景推理前的几何 grounding 框架,将几何信息视为时空推理的 representational prerequisite。GeoWeaver 从冻结的几何编码器构建多层几何库,并执行 token-adaptive 的几何证据分配,使每个视觉标记都能检索到最相关的几何抽象。所选证据通过残差 grounding 操作纳入视觉标记,于是于语言建模前,产生面向下游推理的几何 grounding 表示。对时空推理基准进行了广泛评估,结果表明 GeoWeaver 在保持一般多模态能力的同时,持续增强几何感知推理。这表明,几何信息并非作为后期融合的辅助信号,而应作为塑造大型语言模型推理所基于 representational foundation 的根本性先决条件。所有源代码和模型将发布于 https://github.com/yahooo-m/GeoWeaver。
关键词
引用
@article{arxiv.2605.22558,
title = {GeoWeaver: Grounding Visual Tokens with Geometric Evidence before Scene Reasoning},
author = {Deshui Miao and Xingsen Huang and Yameng Gu and Xin Li and Haijun Zhang and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2605.22558},
year = {2026}
}