规划以实践:通过在潜在空间中组合目标进行高效在线微调
机器人学
2023-04-19 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
通用机器人需要多样化的行为库,以在现实世界的非结构化环境中完成具有挑战性的任务。为了解决这个问题,目标条件强化学习旨在获取能够按指令为广泛任务达到可配置目标的策略。然而,这种目标条件策略从零开始训练是出了名的困难且耗时。在本文中,我们提出了“规划以实践”(Planning to Practice, PTP)方法,该方法使得为需要多种不同类型交互来解决的长时序任务训练目标条件策略变得切实可行。我们的方法基于两个关键思想。首先,我们将目标达成问题分层分解,由一个高层规划器在潜在空间中为低层无模型策略使用条件子目标生成器来设定中间子目标。其次,我们提出了一种混合方法,首先通过离线强化学习在先前收集的数据上预训练条件子目标生成器和策略,然后通过在线探索对策略进行微调。这个微调过程本身由规划好的子目标来促进,它将原始目标任务分解为短时序的目标达成任务,这些任务的学习难度显著降低。我们在仿真和现实世界中进行了实验,其中策略在短时基元行为的演示上进行了预训练,并针对离线数据中未见过的、时间上扩展的任务进行了微调。我们的实验结果表明,PTP 能够生成可行的子目标序列,使策略能够高效地解决目标任务。
引用
@article{arxiv.2205.08129,
title = {Planning to Practice: Efficient Online Fine-Tuning by Composing Goals in Latent Space},
author = {Kuan Fang and Patrick Yin and Ashvin Nair and Sergey Levine},
journal= {arXiv preprint arXiv:2205.08129},
year = {2023}
}