中文

机器人预训练:离线强化学习 enables 从少量试验中学习新任务

机器人学 2023-09-26 v3 机器学习

摘要

深度学习的进展凸显了利用多样化机器人数据集实现有效泛化的巨大潜力,这也使得考虑利用广泛的数据集在机器人学习中获得稳健的泛化能力变得颇具吸引力。然而在实践中,我们通常希望在一个先前数据中不太可能包含的新环境中学习一项新技能。因此我们提出:如何将现有的多样化离线数据集与少量特定任务数据相结合来解决新任务,同时仍能享受在大量数据上训练所带来的泛化益处?在本文中,我们证明了端到端的离线强化学习 (RL) 可以成为实现这一目标的有效方法,而无需任何表示学习或基于视觉的预训练。我们提出了用于机器人的预训练 (PTR),这是一个基于离线 RL 的框架,该框架试图通过在现有机器人数据集上进行预训练并结合对新任务的快速微调,来有效地学习新任务,仅需 10 个演示。PTR 利用了一种现有的离线 RL 方法,即保守 Q 学习 (CQL),但对其进行了扩展,包含了几项关键的设计决策,使得 PTR 能够实际有效并优于多种先前的方法。据我们所知,PTR 是第一个通过有效利用在各种玩具厨房中收集的多样化多任务机器人数据集,在真实的 WidowX 机器人上仅需 10 个任务演示就能在新领域中成功学习新任务的 RL 方法。我们还证明了 PTR 能够在少量试验中实现有效的自主微调和改进,而无需任何演示。配套的概述视频可在补充材料和以下 URL 中找到:https://sites.google.com/view/ptr-final/

关键词

引用

@article{arxiv.2210.05178,
  title  = {Pre-Training for Robots: Offline RL Enables Learning New Tasks from a Handful of Trials},
  author = {Aviral Kumar and Anikait Singh and Frederik Ebert and Mitsuhiko Nakamoto and Yanlai Yang and Chelsea Finn and Sergey Levine},
  journal= {arXiv preprint arXiv:2210.05178},
  year   = {2023}
}