中文

Holi-Spatial:将视频流演化为整体3D空间智能

计算机视觉与模式识别 2026-03-10 v1

摘要

空间智能的追求基本依赖于获取大规模、精细粒度的3D数据。然而,现有方法主要通过从有限数量的手动标注数据集生成问答(QA)对来构建空间理解基准,而非系统地从原始网络数据中对新大规模3D场景进行标注。结果是其可扩展性受到严格限制,模型性能也受到这些狭窄精选数据集固有的域间差异的阻碍。本文我们提出Holi-Spatial,第一个完全自动化、大规模、具空间感知性的多模态数据集,由原始视频输入构建,无需人工干预,采用我们提出的数据 curated pipeline。Holi-Spatial支持多级空间监督,从具有渲染深度图的几何精确的3D Gaussian Splatting(3DGS)重建,到对象级和关系语义标注,以及相应的空间问答(QA)对。遵循一种原则性和系统性的 pipeline,我们进一步构建Holi-Spatial-4M,第一个大规模高质量3D语义数据集,包含1.2万个优化后的3DGS场景、130万个2D掩码、32万个3D边界框、32万个实例标题、120万个3D grounding 实例和120万个空间QA对,涵盖多样化的几何、关系和语义推理任务。Holi-Spatial在数据 curated 质量方面表现突出,在诸如ScanNet、ScanNet++和DL3DV等数据集上显著优于现有的前馈和 per-scene 优化方法。此外,使用该数据集对视觉语言模型(VLM)进行空间推理任务的微调也带来了显著的性能提升。

关键词

引用

@article{arxiv.2603.07660,
  title  = {Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence},
  author = {Yuanyuan Gao and Hao Li and Yifei Liu and Xinhao Ji and Yuning Gong and Yuanjun Liao and Fangfu Liu and Manyuan Zhang and Yuchen Yang and Dan Xu and Xue Yang and Huaxi Huang and Hongjie Zhang and Ziwei Liu and Xiao Sun and Dingwen Zhang and Zhihang Zhong},
  journal= {arXiv preprint arXiv:2603.07660},
  year   = {2026}
}

备注

project page: https://visionary-laboratory.github.io/holi-spatial/