中文

探究几何-交互线索在视觉基础模型中的感官推理

计算机视觉与模式识别 2026-03-17 v3

摘要

视觉系统对感官推理的真正理解意味着什么?我们认为,这种理解取决于两种互补能力:几何感知,它识别启用交互的对象结构部件;交互感知,它建模代理动作如何与这些部件发生作用。为测试这一假设,我们对视觉基础模型 (VFM) 进行系统性探针测试。我们发现,像 DINO 这样的模型本质上编码了部件级几何结构,而像 Flux 这样的生成模型则包含丰富的动词条件化空间注意力图,这些图作为隐式交互先验。关键的是,我们证明了这两个维度不仅是相关的,而且是感官推理的可组合元素。通过仅仅融合 DINO 的几何原型与 Flux 的交互图以无训练和零-shot 方式,我们实现了与弱监督方法竞争的感官估计。该最终融合实验确认了几何和交互感知是 VFM 中感官理解的基本构建块,提供了感知如何 grounding 行动的机制性解释。

关键词

引用

@article{arxiv.2602.20501,
  title  = {Probing and Bridging Geometry-Interaction Cues for Affordance Reasoning in Vision Foundation Models},
  author = {Qing Zhang and Xuesong Li and Jing Zhang},
  journal= {arXiv preprint arXiv:2602.20501},
  year   = {2026}
}

备注

11 pages, 12 figures, Accepted to CVPR 2026