中文

视觉-语言-动作模型通用性基准测试

机器学习 2025-12-15 v1

摘要

通用多模态智能体有望统一感知、语言与控制,在多样化的真实世界领域上鲁棒运行。然而,当前的评估实践仍分散于孤立的基准测试中,难以判断当今的基础模型是否真正超越了其训练分布之外的泛化能力。我们提出 MultiNet v1.0,一个用于衡量视觉语言模型(VLMs)和视觉语言动作模型(VLAs)跨六个基础能力领域通用性的统一基准:视觉定位、空间推理、工具使用、物理常识、多智能体协作与连续机器人控制。评估 GPT 5、Pi0 和 Magma 后,我们发现没有任何模型展现出稳定的通用性。所有模型在未见领域、不熟悉模态或跨域任务迁移中均出现显著退化,尽管在其训练分布内表现强劲。这些失败表现为模态错位、输出格式不稳定以及域迁移下的灾难性知识退化。我们的发现揭示了通用智能的愿景与当前基础模型实际能力之间的持续差距。MultiNet v1.0 为诊断这些差距并指导未来通用智能体的发展提供了标准化的评估平台。代码、数据和排行榜均公开可用。

关键词

引用

@article{arxiv.2512.11315,
  title  = {Benchmarking the Generality of Vision-Language-Action Models},
  author = {Pranav Guruprasad and Sudipta Chowdhury and Harsh Sikka and Mridul Sharma and Helen Lu and Sean Rivera and Aryan Khurana and Hangliang Ren and Yangyue Wang},
  journal= {arXiv preprint arXiv:2512.11315},
  year   = {2025}
}

备注

23 pages, 7 figures, and 1 table