Octo:开源通用机器人策略
机器人学
2024-05-28 v2 机器学习
摘要
在多样化机器人数据集上预训练的大型策略具有变革机器人学习的潜力:无需从头训练新策略,这类通用机器人策略仅需少量领域内数据即可进行微调,并具备广泛的泛化能力。然而,为了能在各种机器人学习场景、环境和任务中广泛适用,此类策略需要处理多样化的传感器与动作空间,兼容各种常用的机器人平台,并能轻松高效地微调至新领域。在本工作中,我们旨在为开发开源、广泛适用的机器人操作通用策略奠定基础。作为第一步,我们引入了 Octo,这是一种基于 Transformer 的大型策略,在 Open X-Embodiment 数据集(迄今最大的机器人操作数据集)的 80 万条轨迹上进行训练。它可以通过语言指令或目标图像进行引导,并能在标准消费级 GPU 上于数小时内有效微调至具有新感知输入和动作空间的机器人配置中。在 9 个机器人平台的实验中,我们证明 Octo 可作为通用的策略初始化,并能有效微调至新的观测与动作空间。我们还对 Octo 模型的设计决策(从架构到训练数据)进行了详细的消融研究,以指导未来构建通用机器人模型的研究。
引用
@article{arxiv.2405.12213,
title = {Octo: An Open-Source Generalist Robot Policy},
author = {Octo Model Team and Dibya Ghosh and Homer Walke and Karl Pertsch and Kevin Black and Oier Mees and Sudeep Dasari and Joey Hejna and Tobias Kreiman and Charles Xu and Jianlan Luo and You Liang Tan and Lawrence Yunliang Chen and Pannag Sanketi and Quan Vuong and Ted Xiao and Dorsa Sadigh and Chelsea Finn and Sergey Levine},
journal= {arXiv preprint arXiv:2405.12213},
year = {2024}
}
备注
Project website: https://octo-models.github.io