中文

SpatialBench:你的空间基础模型是全能选手吗?

计算机视觉与模式识别 2026-05-27 v1

摘要

尽管空间基础模型在标准数据集上展示了令人印象深刻的性能,但一个关键问题仍然存在:它们是否真正是能够跨不同下游任务、任意视角、变化的场景域、变化的输入密度以及特定硬件约束进行稳健泛化的全能选手?回答这个首要问题需要一个全面的评估,然而当前模型主要在其专门设计或训练的特定领域上进行评估。这种评估本质上受到狭窄范式覆盖、有限场景域和任意帧采样的限制,使得从根本上评估其真正的泛化能力变得困难。为了填补这一空白,我们提出了 SpatialBench,一个用于空间基础模型的跨范式、域多样化的基准,具有确定性采样。SpatialBench 具有前所未有的规模和严格的确定性设计,包含 19 个数据集和 546 个场景,涵盖 5 个不同的空间域。它在 4 种不同输入密度设置下,对 6 个范式的 41 个模型在 5 个任务套件上进行了全面评估。我们广泛的评估揭示,当前模型还不是全能选手,并为未来的进步揭示了关键见解。具体来说,我们证明了全上下文注意力最大化精度,而有界内存策略则解锁了长序列可扩展性。此外,我们在具有挑战性的具身和自我中心任务中的实证评估表明,严格的对齐和高数据质量对于性能远比简单的数据集缩放更为关键。此外,为了解决我们分析中识别出的最大数据缺口,我们超越了评估,引入了一个大规模数据集 DA-Next-5M 和一个强基线模型 DA-Next,推动了空间表示学习的边界。

关键词

引用

@article{arxiv.2605.27367,
  title  = {SpatialBench: Is Your Spatial Foundation Model an All-Round Player?},
  author = {Haosong Peng and Hao Li and Jiaqi Chen and Yuhao Pan and Runmao Yao and Yalun Dai and Fushuo Huo and Fangzhou Hong and Zhaoxi Chen and Haozhao Wang and Dingwen Zhang and Ziwei Liu and Wenchao Xu},
  journal= {arXiv preprint arXiv:2605.27367},
  year   = {2026}
}

备注

Project Page: https://ropedia.github.io/SpatialBench/