中文

The Great March 100:用于评估具身智能体的 100 项面向细节的任务

机器人学 2026-01-19 v1 人工智能

摘要

最近,随着机器人学习和模仿学习的快速发展,出现了大量的数据集和方法。然而,这些数据集及其任务设计往往缺乏系统的考虑和原则。这引发了一个重要问题:当前的数据集和任务设计是否真正提升了机器智能体的能力?在少数常见任务上的评估是否能准确反映不同团队提出并在不同任务上评估的各种方法的差异化性能?为了解决这些问题,我们引入了 Great March 100(\textbf{GM-100})作为迈向机器人学习奥林匹克的第一步。GM-100 包含 100 个精心设计的任务,涵盖了广泛的交互和长尾行为,旨在提供一组多样且具有挑战性的任务,以全面评估机器智能体的能力,并促进机器人数据集任务设计的多样性和复杂性。这些任务是通过对现有任务设计的系统分析和扩展,结合对人物交互基元和物体可供性的见解而开发的。我们在不同的机器人平台上收集了大量轨迹数据,并评估了几个基线模型。实验结果表明,GM-100 任务 1) 可执行,且 2) 具有足够的挑战性,能有效区分当前 VLA 模型的性能。我们的数据和代码可在 https://rhos.ai/research/gm-100 获取。

关键词

引用

@article{arxiv.2601.11421,
  title  = {The Great March 100: 100 Detail-oriented Tasks for Evaluating Embodied AI Agents},
  author = {Ziyu Wang and Chenyuan Liu and Yushun Xiang and Runhao Zhang and Qingbo Hao and Hongliang Lu and Houyu Chen and Zhizhong Feng and Kaiyue Zheng and Dehao Ye and Xianchao Zeng and Xinyu Zhou and Boran Wen and Jiaxin Li and Mingyu Zhang and Kecheng Zheng and Qian Zhu and Ran Cheng and Yong-Lu Li},
  journal= {arXiv preprint arXiv:2601.11421},
  year   = {2026}
}