RieMind:面向场景理解的几何 grounding 空间智能体
环与代数
2026-03-17 v1
摘要
视觉语言模型 (VLM) 越来越成为理解室内场景的主要范例,但它们仍在度量和空间推理方面存在挑战。当前方法依赖于端到端视频理解或大规模空间问答微调,本质上将感知与推理耦合。在本文中,我们调查了通过解耦感知与推理是否导致空间推理性能提升。我们提出了一个针对静态 3D 室内场景推理的 agentic 框架,将 LLM 锚定在显式 3D 场景图 (3DSG) 上。不同于直接摄入视频,每个场景被表示为由专门的感知模块构建的持久 3DSG。为隔离推理性能,我们从 ground-truth 注释中实例化 3DSG。该智能体仅通过结构化几何工具与场景交互,这些工具暴露基本属性,如物体尺寸、距离、姿态和空间关系。我们在 VSI-Bench static split 上获得的结果在理想感知条件下提供了空间推理性能的上限,我们发现其性能比以前的工作高出最高可达 16\%,且无需特定任务微调。相对于 base VLM,我们的 agentic 变体在性能上显著优于基准,平均提升幅度在 33\% 到 50\% 之间。这些发现表明,显式几何锚定显著提升了空间推理性能,并表明结构化表示为纯粹的端到端视觉推理提供了有竞争力的替代方案。
关键词
引用
@article{arxiv.2603.15385,
title = {Point varieties and point-exactness of Koszul algebras},
author = {Haigang Hu and Wenchao Wu and Yu Ye},
journal= {arXiv preprint arXiv:2603.15385},
year = {2026}
}
备注
22 pages; all comments are welcome