跳跃启动强化学习
机器学习
2023-07-11 v2
摘要
强化学习(RL)提供了一个理论框架,通过试错持续改进行为。然而,从零开始高效学习策略可能非常困难,尤其是对于具有探索挑战的任务。在此类设定中,用现有策略、离线数据或演示来初始化RL可能是可取的。然而,在RL中朴素地执行此类初始化往往效果很差,尤其是对于基于值的方法。在本文中,我们提出一种元算法,可使用离线数据、演示或预存在策略来初始化RL策略,并且与任何RL方法兼容。具体而言,我们提出跳跃启动强化学习(JSRL),一种采用两个策略来解决任务的算法:引导策略和探索策略。通过使用引导策略为探索策略形成起始状态课程,我们能够在一组模拟机器人任务上高效提升性能。我们通过实验表明,JSRL能够显著优于现有的模仿与强化学习算法,尤其是在小数据体制下。此外,我们给出了JSRL样本复杂度的上界,并证明在引导策略的帮助下,可将非乐观探索方法的样本复杂度从关于视界指数级改进为多项式级。
引用
@article{arxiv.2204.02372,
title = {Jump-Start Reinforcement Learning},
author = {Ikechukwu Uchendu and Ted Xiao and Yao Lu and Banghua Zhu and Mengyuan Yan and Joséphine Simon and Matthew Bennice and Chuyuan Fu and Cong Ma and Jiantao Jiao and Sergey Levine and Karol Hausman},
journal= {arXiv preprint arXiv:2204.02372},
year = {2023}
}
备注
20 pages, 10 figures