机器人微调变得简单:面向自主真实世界强化学习的预训练奖励与策略
机器人学
2023-10-24 v1 人工智能
机器学习
摘要
机器学习中的预训练与微调范式在广泛领域中取得巨大成功,因为利用互联网上的现有数据或预训练模型可实现新任务的快速轻松学习。我们旨在将这一范式引入机器人强化学习,使机器人能借助互联网的数据与模型,以极少人力学习新任务。然而,即便策略已预训练,强化学习常需大量人力进行手动奖励设定或环境重置。我们提出 RoboFuME,一个无重置微调系统,它从先前的多样经验数据集中预训练多任务操作策略,并在线自我改进,以最少人工干预学习目标任务。我们的核心思路是利用校准的离线强化学习技术,确保在分布偏移下预训练策略的高效在线微调,并借助预训练的视觉语言模型(VLMs)构建鲁棒奖励分类器,在在线微调过程中自主提供奖励信号。在五项真实机器人操作任务的多样集合中,我们展示本方法能融合来自其他机构已有机器人数据集的数据,并在少至 3 小时自主真实世界经验内改进目标任务。我们还在仿真实验中证明,本方法优于使用不同 RL 算法或不同奖励预测方法的已有工作。项目网站:https://robofume.github.io
引用
@article{arxiv.2310.15145,
title = {Robot Fine-Tuning Made Easy: Pre-Training Rewards and Policies for Autonomous Real-World Reinforcement Learning},
author = {Jingyun Yang and Max Sobol Mark and Brandon Vu and Archit Sharma and Jeannette Bohg and Chelsea Finn},
journal= {arXiv preprint arXiv:2310.15145},
year = {2023}
}