桥接模仿与在线强化学习:一个乐观的故事
机器学习
2023-07-18 v2 人工智能
摘要
在本文中,我们解决如下问题:给定一个来自不完美专家的离线演示数据集,利用其引导 MDP 中在线学习性能的最佳方式是什么。我们首先提出一种基于信息后验采样的强化学习(iPSRL)算法,该算法利用离线数据集以及生成该离线数据集所用专家行为策略的信息。若专家足够胜任,其累积贝叶斯遗憾随离线数据集大小 N 以指数速度降至零。由于该算法在计算上不切实际,我们进而提出 iRLSVI 算法,可视为在线 RL 的 RLSVI 算法与模仿学习的结合。我们的经验结果表明,与两个基线(无离线数据,以及有离线数据但未利用生成策略信息)相比,所提出的 iRLSVI 算法能显著减少遗憾。我们的算法首次桥接了在线 RL 与模仿学习。
引用
@article{arxiv.2303.11369,
title = {Bridging Imitation and Online Reinforcement Learning: An Optimistic Tale},
author = {Botao Hao and Rahul Jain and Dengwang Tang and Zheng Wen},
journal= {arXiv preprint arXiv:2303.11369},
year = {2023}
}
备注
Alphabetical order. Corresponding to Rahul Jain