SpatialScore:面向空间智能的全面评估
计算机视觉与模式识别
2026-04-14 v3 人工智能
摘要
现有的多模态大语言模型(MLLM)在空间智能评估上通常是碎片化且范围受限的。本文旨在对现代MLLM的空间理解能力进行整体评估,并提出数据驱动和基于代理的补充解决方案。具体贡献包括:(i)我们引入SpatialScore,据称目前最全面且样本多样化的多模态空间智能基准测试。它涵盖多种视觉数据类型、输入模态和问答格式,包含约5000个经过人工验证的样本,涵盖30个不同任务;(ii)使用SpatialScore,我们广泛评估了49个代表性MLLM,揭示了持续的挑战以及当前模型与人类水平空间智能之间的巨大差距;(iii)为提升模型能力,我们构建SpatialCorpus,一个规模庞大的训练资源,包含33.1万个多模态QA样本,支持针对空间推理任务的微调,显著提升了现有模型(如Qwen3-VL)的性能(如Qwen3-VL);(iv)为补充数据驱动方法,我们开发SpatialAgent,一个由12个专业空间感知工具构成的多智能体系统,支持Plan-Execute和ReAct推理,使其在无需额外模型训练的情况下实现显著的空间推理提升。大量实验和深入分析均证明了我们基准、语料库和智能体框架的有效性。我们预期这些资源将为推动MLLM向人类水平的空间智能提供坚实基础。所有数据、代码和模型将公开释放给研究社区。
引用
@article{arxiv.2505.17012,
title = {SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence},
author = {Haoning Wu and Xiao Huang and Yaohui Chen and Ya Zhang and Yanfeng Wang and Weidi Xie},
journal= {arXiv preprint arXiv:2505.17012},
year = {2026}
}
备注
Accepted by CVPR 2026 (Highlight); Project Page: https://haoningwu3639.github.io/SpatialScore