中文

穿越视角:基于机器人场景的视觉语言模型空间推理基准测试

计算机视觉与模式识别 2026-03-03 v2

摘要

视觉语言模型(VLM)是具身人工智能的关键组件,使机器人能够在复杂环境中感知、推理并行动。它们也是最近出现的视觉语言-动作(VLA)模型的基础。然而,大多数VLM评估聚焦于单视图场景,缺乏对其整合多视图信息能力的探讨。与此同时,多摄像头 setup 正在机器人平台中日益标准化,因为它们提供互补视角以缓解遮挡和深度歧义。因此,VLM 是否能够有效利用多视图输入进行机器人推理 remains 一个未解之谜。为填补这一差距,我们引入了 MV-RoboBench,这是一个专为评估VLM在机器人操作中多视图空间推理能力而设计的基准测试。MV-RoboBench 包含 1700 份人工精选的 QA 项目,分为八个子任务,分为两个主要类别:空间理解和机器人执行。我们评估了多样化的现有VLM,包括开源和闭源模型,以及 incorporating CoT 启发技术的增强版本。结果显示,领先的模型仍远低于人类水平,凸显了VLM在多视图机器人感知中面临的重大挑战。此外,我们的分析发现两个关键发现:(i)在多视图机器人场景中,空间智力和机器人任务执行呈正相关;(ii)在现有通用单视图空间理解基准测试中表现优异的模型,并不一定能可靠地转化为在我们的基准测试所评估的机器人空间任务中的成功。我们将 MV-RoboBench 作为开放资源发布,以促进空间导向VLM和VLA的进展,提供不仅仅是数据,还提供用于多视图具身推理的标准化评估协议。

关键词

引用

@article{arxiv.2510.19400,
  title  = {Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes},
  author = {Zhiyuan Feng and Zhaolu Kang and Qijie Wang and Zhiying Du and Jiongrui Yan and Shubin Shi and Chengbo Yuan and Huizhi Liang and Yu Deng and Qixiu Li and Rushuai Yang and Arctanx An and Leqi Zheng and Weijie Wang and Shawn Chen and Sicheng Xu and Yaobo Liang and Jiaolong Yang and Baining Guo},
  journal= {arXiv preprint arXiv:2510.19400},
  year   = {2026}
}

备注

Accepted to ICLR 2026. Camera-ready version. Project page: https://aaronfengzy.github.io/MV-RoboBench-Webpage/