VIEW2SPACE:稀疏观测下的多视角视觉推理
最优化与控制
2026-03-18 v1
摘要
多视角视觉推理是智能系统不可避免的需求,其必须从稀疏且离散的视点中理解复杂环境,但现有研究大多聚焦于单图像或时序密集视频场景。在现实场景中,跨视角的推理需要在无明确指导的情况下整合部分观测,而大规模多视角数据收集仍面临几何与语义标注困难的问题。为此,我们利用基于物理的仿真构建多样化、高保真度的 3D 场景,确保存储每个视角的精确元数据,从而实现可扩展的数据生成,同时保持对真实场景的可迁移性。基于此引擎,我们引入 VIEW2SPACE,一个用于稀疏多视角推理的多维基准数据集,搭建了一个支持数百万个具备几何约束的问答对的可扩展、互斥训练划分。利用该基准,对当前主流视觉语言和空间模型进行了全面评估,表明多视角推理仍基本未被解决,大多数模型仅略高于随机猜测。我们进一步探讨了训练是否能弥合这一差距。我们提出的基于视觉证据的 Grounded Chain-of-Thought 方法显著提升了中等难度下的性能,并在跨数据集评估中超越现有方法。我们进一步进行了难度感知的规模分析,涵盖模型规模、数据规模、推理深度以及可见性约束,表明在充足可见性下,几何感知可通过规模化获得帮助,但跨稀疏视角的深层组合推理仍是根本性挑战。
引用
@article{arxiv.2603.16505,
title = {Clash of MINLP Relaxations: Piecewise Linear vs. Global Parabolic},
author = {Adrian Göß},
journal= {arXiv preprint arXiv:2603.16505},
year = {2026}
}
备注
32 pages, 12 figures, 4 tables, currently under review