中文

FLaRe: 通过大规模强化学习微调实现精通且自适应的机器人策略

机器人学 2024-10-02 v2 计算机视觉与模式识别 机器学习

摘要

近年来,机器人领域已启动了多项通过大规模多任务行为克隆构建通用机器人策略的努力。然而,直接部署这些策略导致了令人不满意的性能,策略在未见过的状态和任务中表现挣扎。我们如何突破这些模型的性能瓶颈并将其能力提升至新高度?在本文中,我们提出了 FLaRe,一个大规模强化学习微调框架,集成了鲁棒的预训练表示、大规模训练和梯度稳定技术。我们的方法使预训练策略向任务完成方向对齐,在先前演示过的任务以及全新的任务和实体上均实现了最先进(SoTA)的性能。具体而言,在一组长时程移动操作任务上,FLaRe 在未见过的环境中实现了 79.5% 的平均成功率,在模拟和真实机器人上分别比先前的 SoTA 方法绝对提升了 +23.6% 和 +30.7%。仅利用稀疏奖励,我们的方法能够以极低的人力成本实现向超越预训练数据的新能力的泛化。此外,我们展示了在不到一天的微调时间内即可快速适应新的实体和行为。视频可在项目网站 https://robot-flare.github.io/ 上找到。

关键词

引用

@article{arxiv.2409.16578,
  title  = {FLaRe: Achieving Masterful and Adaptive Robot Policies with Large-Scale Reinforcement Learning Fine-Tuning},
  author = {Jiaheng Hu and Rose Hendrix and Ali Farhadi and Aniruddha Kembhavi and Roberto Martin-Martin and Peter Stone and Kuo-Hao Zeng and Kiana Ehsani},
  journal= {arXiv preprint arXiv:2409.16578},
  year   = {2024}
}