桥接离线强化学习与模仿学习:悲观主义一谈
机器学习
2023-07-04 v2 人工智能
最优化与控制
统计理论
机器学习
统计理论
摘要
离线(或批量)强化学习(RL)算法旨在从固定数据集中学习最优策略,而无须主动数据收集。基于离线数据集的构成,主要使用两类方法:适用于专家数据集的模仿学习,以及通常需要均匀覆盖数据集的普通离线 RL。从实践角度看,数据集常偏离这两类极端情况,且确切数据构成通常事先未知。为弥合此差距,我们提出一个新的离线 RL 框架,可平滑插值于数据构成的两极端之间,从而统一模仿学习与普通离线 RL。该新框架围绕一个弱版的可集中系数展开,该系数度量行为策略偏离专家策略本身的程度。在此新框架下,我们进一步探究算法设计问题:能否开发一种既达到极小极大最优率又自适应未知数据构成的算法?为解答此问,我们考虑基于离线 RL 中不确定性面前悲观主义的下置信界(LCB)算法。我们研究了 LCB 的有限样本性质以及多臂_bandit、上下文_bandit 与马尔可夫决策过程(MDPs)中的信息论极限。我们的分析揭示了关于最优率的惊人事实。特别是在所有三种设定中,对于近专家数据集,LCB 实现了 的更快速率,而非离线 RL 中通常的 速率,其中 为批量数据集中的样本数。在至少含两个上下文的上下文_bandit 情形中,我们证明 LCB 对整个数据构成范围自适应最优,实现了从模仿学习到离线 RL 的平滑过渡。我们进一步表明 LCB 在 MDPs 中近乎自适应最优。
引用
@article{arxiv.2103.12021,
title = {Bridging Offline Reinforcement Learning and Imitation Learning: A Tale of Pessimism},
author = {Paria Rashidinejad and Banghua Zhu and Cong Ma and Jiantao Jiao and Stuart Russell},
journal= {arXiv preprint arXiv:2103.12021},
year = {2023}
}