SpatialReasoner:大规模3D场景理解的主动感知
计算机视觉与模式识别
2025-12-04 v1
摘要
大规模3D环境中的空间推理对当前的视觉语言模型而言仍然具有挑战性,因为这些模型通常局限于房间级场景。我们引入了H²U3D(Holistic House Understanding in 3D),一个面向房屋级场景理解的3D视觉问答数据集。H²U3D包含跨越最多三层和10-20个房间的多层环境,覆盖面积超过300平方米。通过自动化标注流水线,它构建了从粗到细的层次化视觉表示,并生成了带有思维链标注的多样化问答对。我们进一步提出了SpatialReasoner,一个主动感知框架,能够根据文本查询自主调用空间工具来探索3D场景。SpatialReasoner通过两阶段策略进行训练:监督冷启动,随后使用自适应探索奖励的强化学习,该奖励促进高效探索同时抑制冗余操作。广泛的实验表明,SpatialReasoner在H²U3D上达到了最先进的性能,超越了包括GPT-4o和Gemini-2.5-Pro在内的强基线。值得注意的是,我们的方法平均仅使用3-4张图像即可取得优越结果,而基线需要16张以上图像,突显了我们从粗到细的主动探索范式的有效性。
引用
@article{arxiv.2512.03284,
title = {SpatialReasoner: Active Perception for Large-Scale 3D Scene Understanding},
author = {Hongpei Zheng and Shijie Li and Yanran Li and Hujun Yin},
journal= {arXiv preprint arXiv:2512.03284},
year = {2025}
}