中文

MOTO:从离线预训练到在线微调的基于模型的机器人学习

机器学习 2024-01-09 v1 人工智能 机器人学

摘要

我们研究了在现实机器人任务背景下,针对高维观测值的强化学习的离线预训练和在线微调问题。最近的离线无模型方法成功利用在线微调来提高智能体相对于数据收集策略的性能,或适应新任务。同时,基于模型的 RL 算法在样本效率和可解决任务的复杂性方面取得了显著进展,但在微调设置中仍未得到充分利用。在这项工作中,我们认为现有的基于模型的离线 RL 方法由于分布偏移、非动态数据和奖励非平稳性问题,不适合高维域中的离线到在线微调。我们提出了一种基于策略的基于模型的方法,该方法可以通过基于模型的价值扩展和策略正则化有效地重用先验数据,同时通过控制认知不确定性来防止模型利用。我们发现我们的方法成功解决了 MetaWorld 基准测试中的任务,以及完全基于图像的 Franka Kitchen 机器人操作环境。据我们所知,MOTO 是第一个从像素解决该环境的方法。

关键词

引用

@article{arxiv.2401.03306,
  title  = {MOTO: Offline Pre-training to Online Fine-tuning for Model-based Robot Learning},
  author = {Rafael Rafailov and Kyle Hatch and Victor Kolev and John D. Martin and Mariano Phielipp and Chelsea Finn},
  journal= {arXiv preprint arXiv:2401.03306},
  year   = {2024}
}

备注

This is an updated version of a manuscript that originally appeared at CoRL 2023. The project website is here https://sites.google.com/view/mo2o