多模态动作模型评估与适应的开源软件工具包与基准套件
机器学习
2025-06-18 v2 计算机视觉与模式识别
摘要
近期在多模态动作模型方面的创新正在为开发通用智能体系统提供可前景之利,融合了视觉理解、语言理解与动作生成能力。我们引入 MultiNet - 一个全新且完全开源的基准及其周边软件生态系统,旨在严格评估和适应跨视觉、语言与动作领域的模型。我们建立了标准化评估协议,用于评估视觉-语言模型 (Vision-Language Models, VLMs) 和视觉-语言-动作模型 (Vision-Language-Action Models, VLAs),并提供开源软件用于下载相关数据、模型及评估。此外,我们提供了一个包含 13000 亿元以上图像字幕、视觉问答、常识推理、机器人控制、数字游戏玩法、模拟 locomotion/manipulation 等多项任务的复合数据集。MultiNet 基准、框架、工具包及评估平台已用于下游研究中评估 VLA 泛化能力的局限性。
引用
@article{arxiv.2506.09172,
title = {An Open-Source Software Toolkit & Benchmark Suite for the Evaluation and Adaptation of Multimodal Action Models},
author = {Pranav Guruprasad and Yangyue Wang and Sudipta Chowdhury and Jaewoo Song and Harshvardhan Sikka},
journal= {arXiv preprint arXiv:2506.09172},
year = {2025}
}
备注
ICML CodeML Workshop, 13 Pages, 6 Figures, 2 Tables