GR-3 技术报告
机器人学
2025-07-23 v2 人工智能
计算机视觉与模式识别
摘要
我们报告了近期在构建通用机器人策略方面的进展,即 GR-3。GR-3 是一个大规模视觉-语言-动作 (VLA) 模型。它在针对 novel objects、environments and instructions involving abstract concepts 方面展现了卓越的泛化能力。此外,它可以通过最小的人类轨迹数据进行高效微调,实现快速且高效的适应。GR-3 还在处理长时段和灵巧任务方面表现出色,包括需要双手操作和移动动作的任务,展现出稳健可靠的性能。这些能力通过多方面的训练配方实现,包括与 web 规模视觉-语言数据共训练、通过 VR 设备收集的人类轨迹数据进行高效微调,以及与机器人轨迹数据有效的模仿学习。此外,我们引入了 ByteMini—a 一种具备极佳灵活性和可靠性的双手移动机器人,能够在集成 GR-3 时完成广泛任务。通过大量真实世界实验,我们展示 GR-3 在各种具有挑战性的任务上超越了领先的基线方法 。我们希望 GR-3 能成为通用机器人能够在日常生活中帮助人类的一步。
引用
@article{arxiv.2507.15493,
title = {GR-3 Technical Report},
author = {Chilam Cheang and Sijin Chen and Zhongren Cui and Yingdong Hu and Liqun Huang and Tao Kong and Hang Li and Yifeng Li and Yuxiao Liu and Xiao Ma and Hao Niu and Wenxuan Ou and Wanli Peng and Zeyu Ren and Haixin Shi and Jiawen Tian and Hongtao Wu and Xin Xiao and Yuyang Xiao and Jiafeng Xu and Yichu Yang},
journal= {arXiv preprint arXiv:2507.15493},
year = {2025}
}
备注
Tech report. Authors are listed in alphabetical order. Project page: https://seed.bytedance.com/GR3/