中文

GR-2: 一种具有网络规模知识的生成式视频-语言-动作模型用于机器人操作

机器人学 2024-10-10 v1 计算机视觉与模式识别 机器学习

摘要

我们提出了GR-2,一种用于通用且可泛化的机器人操作的最先进通用机器人智能体。GR-2首先在大量互联网视频上进行预训练,以捕捉世界的动态。这种大规模预训练涉及3800万个视频片段和超过500亿个token,使GR-2能够在后续的策略学习过程中泛化到广泛的机器人任务和环境。随后,GR-2使用机器人轨迹对视频生成和动作预测进行微调。它展示了令人印象深刻的多任务学习能力,在超过100个任务中实现了97.7%的平均成功率。此外,GR-2在未见过的全新场景(包括新颖的背景、环境、物体和任务)中表现出卓越的泛化能力。值得注意的是,GR-2随模型规模有效扩展,凸显了其持续增长和应用的潜力。项目页面:\url{https://gr2-manipulation.github.io}。

关键词

引用

@article{arxiv.2410.06158,
  title  = {GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation},
  author = {Chi-Lam Cheang and Guangzeng Chen and Ya Jing and Tao Kong and Hang Li and Yifeng Li and Yuxiao Liu and Hongtao Wu and Jiafeng Xu and Yichu Yang and Hanbo Zhang and Minzhao Zhu},
  journal= {arXiv preprint arXiv:2410.06158},
  year   = {2024}
}

备注

Tech Report. Authors are listed in alphabetical order. Project page: https://gr2-manipulation.github.io