中文

CoV:面向空间推理的视点链提示

计算机视觉与模式识别 2026-01-12 v2 人工智能

摘要

三维环境中的具身问答 (EQA) 通常需要收集分布在多个视点且部分被遮挡的上下文。然而,近期的视觉-语言模型 (VLM) 大多受限于固定且有限的输入视角,这限制了它们在推理时获取与问题相关的上下文的能力,并阻碍了复杂空间推理。我们提出了视点链 提示,这是一种免训练的测试时推理框架,通过由粗到细的探索过程将 VLM 转化为主动视点推理器。CoV 首先采用视点选择智能体过滤冗余帧并识别与问题对齐的锚点视角。随后,它通过将迭代推理与离散相机动作交错执行来进行细粒度视点调整,从底层三维场景表示中获取新观测,直到收集到足够的上下文或达到步数预算上限。我们在 OpenEQA 上跨四个主流 VLM 评估了 CoV,在 LLM-Match 上获得了平均 +11.56% 的提升,在 Qwen3-VL-Flash 上的最大增益达 +13.62%。CoV 进一步展现出测试时缩放特性:增加最小动作预算可带来平均 +2.51% 的额外提升,在 Gemini-2.5-Flash 上达到 +3.73% 的峰值。在 ScanQA 和 SQA3D 上,CoV 交付了强劲的性能(例如,ScanQA 上 116 CIDEr / 31.9 EM@1,SQA3D 上 51.1 EM@1)。总体而言,这些结果表明,与问题对齐的视点选择结合开放视角搜索,是一种无需额外训练即可提升三维 EQA 空间推理的有效且模型无关的策略。代码可在 https://github.com/ziplab/CoV 获取。

关键词

引用

@article{arxiv.2601.05172,
  title  = {CoV: Chain-of-View Prompting for Spatial Reasoning},
  author = {Haoyu Zhao and Akide Liu and Zeyu Zhang and Weijie Wang and Feng Chen and Ruihan Zhu and Gholamreza Haffari and Bohan Zhuang},
  journal= {arXiv preprint arXiv:2601.05172},
  year   = {2026}
}

备注

Code link https://github.com/ziplab/CoV