SpaCE-10:用于组合空间智能的多模态大语言模型综合基准
计算机视觉与模式识别
2025-10-08 v4
摘要
多模态大语言模型(MLLMs)在 various 多模态任务中取得了显著进展。为了实现更高的空间智能,MLLMs 需要整合多个空间能力,甚至在处理简单和常规任务时也需要这些能力。然而,现有基准难以从原子层面到组合层面全面评估常规 MLLMs 的空间智能。为填补这一空白,我们提出 SpaCE-10,一个用于组合空间评估的综合基准。在 SpaCE-10 中,我们定义了 10 项原子空间能力,这些能力组合形成 8 项组合能力。基于这些定义,我们提出了一种新颖的分层标注管道,用于生成高质量且多样的问答对。通过超过 150 小时的专家人工 effort,我们获得了超过 5000 条问答对,覆盖 811 个真实室内场景,这些场景涵盖了点云输入和多选问答等 various 评估设置。我们对 common MLLMs 在 SpaCE-10 上的进行了广泛评估,发现即使是最先进的 MLLM 在人类水平上仍存在显著差距。通过我们的深入研究,我们还得出了若干重要发现,这些发现有助于 MLLM 社区。例如,我们揭示了计数能力的短板严重限制了现有 MLLMs 的组合空间能力。
引用
@article{arxiv.2506.07966,
title = {SpaCE-10: A Comprehensive Benchmark for Multimodal Large Language Models in Compositional Spatial Intelligence},
author = {Ziyang Gong and Wenhao Li and Oliver Ma and Songyuan Li and Zhaokai Wang and Songyuan Li and Jiayi Ji and Xue Yang and Gen Luo and Junchi Yan and Rongrong Ji},
journal= {arXiv preprint arXiv:2506.07966},
year = {2025}
}