中文

以 BusyBox 为基准测试视觉语言-动作模型的可affordance 泛化

机器人学 2026-02-06 v1 人工智能

摘要

视觉语言-动作(VLA)模型因其具备泛化能力的前景而受到研究者和实践者的关注。尽管单任务策略仍能提供具竞争力的性能,但 VLAs 正日益能够处理训练集中未见过的命令和环境。虽然在视觉和语言空间的泛化无疑是实现稳健通用行为的关键,但 VLAs 必须具备的关键元技能是可affordance 泛化——即能够处理具有熟悉物理特征的新对象的操作。本文提出了 BusyBox,一个用于系统性半自动评估 VLAs 可affordance 泛化的物理基准测试。BusyBox 由 6 个模块组成,包含开关、滑块、线缆、按钮、显示屏和旋钮。这些模块可互换和旋转,以创建各种 BusyBox 变体,变体在视觉外观上不同但保持相同的可affordance 集合。我们经验性地表明,即使是强大的开源 VLAs 如 π0.5\pi_{0.5} 和 GR00T-N1.6,在跨越 BusyBox 变体的泛化仍然极具挑战性。为鼓励研究社区在 BusyBox 上评估自己的 VLAs 并提出新的可affordance 泛化实验,我们设计了 BusyBox 便于在大多数机器人实验室中构建。我们公开了用于 3D 打印其部件的完整 CAD 文件以及(可选的)电子部件采购单。我们还发布了一个使用常用的双手 Mobile Aloha 机器人在标准 BusyBox 配置下收集的语言标注演示数据集。所有公开的材料均可在 https://microsoft.github.io/BusyBox 查阅。

关键词

引用

@article{arxiv.2602.05441,
  title  = {Benchmarking Affordance Generalization with BusyBox},
  author = {Dean Fortier and Timothy Adamson and Tess Hellebrekers and Teresa LaScala and Kofi Ennin and Michael Murray and Andrey Kolobov and Galen Mullins},
  journal= {arXiv preprint arXiv:2602.05441},
  year   = {2026}
}