中文

利用多模态基础模型扩展空间智能

计算机视觉与模式识别 2026-03-31 v4 人工智能 机器学习 多媒体 机器人学

摘要

尽管取得了显著进展,多模态基础模型在空间智能方面仍表现出令人惊讶的不足。在这项工作中,我们探索扩展多模态基础模型以在 SenseNova-SI 系列中培养空间智能,该系列建立在既有的多模态基础之上,包括视觉理解模型 (即 Qwen3-VL 和 InternVL3) 以及统一的理解与生成模型 (即 Bagel)。我们采用一种原则性方法,通过系统性地整理 SenseNova-SI-8M:一个在严格的空间能力分类法下的八百万个多样化数据样本,来构建高性能且稳健的空间智能。SenseNova-SI 在广泛的空间智能基准测试中展示了前所未有的性能:在 VSI-Bench 上达到 68.8%,在 MMSI 上达到 43.3%,在 MindCube 上达到 85.7%,在 ViewSpatial 上达到 54.7%,在 SITE 上达到 47.7%,在 BLINK 上达到 63.9%,在 3DSR 上达到 55.5%,在 EmbSpatial 上达到 72.0%,同时保持了强大的通用多模态理解能力 (例如,在 MMBench-En 上达到 84.9%)。更重要的是,我们分析了数据扩展的影响,讨论了由多样化数据训练带来的涌现泛化能力的早期迹象,分析了过拟合和语言捷径的风险,展示了一项关于空间思维链推理的初步研究,并验证了潜在的下游应用。所有新训练的多模态基础模型均已公开发布。

关键词

引用

@article{arxiv.2511.13719,
  title  = {Scaling Spatial Intelligence with Multimodal Foundation Models},
  author = {Zhongang Cai and Ruisi Wang and Chenyang Gu and Fanyi Pu and Junxiang Xu and Yubo Wang and Wanqi Yin and Zhitao Yang and Chen Wei and Qingping Sun and Tongxi Zhou and Jiaqi Li and Hui En Pang and Oscar Qian and Yukun Wei and Zhiqian Lin and Xuanke Shi and Kewang Deng and Xiaoyang Han and Zukai Chen and Xiangyu Fan and Hanming Deng and Lewei Lu and Liang Pan and Bo Li and Ziwei Liu and Quan Wang and Dahua Lin and Lei Yang},
  journal= {arXiv preprint arXiv:2511.13719},
  year   = {2026}
}

备注

Codebase: https://github.com/OpenSenseNova/SenseNova-SI ; Models: https://huggingface.co/collections/sensenova/sensenova-si . This report is based on the v1.1 version of SenseNova-SI. Accepted to CVPR 2026