中文

桥接离线强化学习与模仿学习:悲观主义一谈

机器学习 2023-07-04 v2 人工智能 最优化与控制 统计理论 机器学习 统计理论

摘要

离线(或批量)强化学习(RL)算法旨在从固定数据集中学习最优策略,而无须主动数据收集。基于离线数据集的构成,主要使用两类方法:适用于专家数据集的模仿学习,以及通常需要均匀覆盖数据集的普通离线 RL。从实践角度看,数据集常偏离这两类极端情况,且确切数据构成通常事先未知。为弥合此差距,我们提出一个新的离线 RL 框架,可平滑插值于数据构成的两极端之间,从而统一模仿学习与普通离线 RL。该新框架围绕一个弱版的可集中系数展开,该系数度量行为策略偏离专家策略本身的程度。在此新框架下,我们进一步探究算法设计问题:能否开发一种既达到极小极大最优率又自适应未知数据构成的算法?为解答此问,我们考虑基于离线 RL 中不确定性面前悲观主义的下置信界(LCB)算法。我们研究了 LCB 的有限样本性质以及多臂_bandit、上下文_bandit 与马尔可夫决策过程(MDPs)中的信息论极限。我们的分析揭示了关于最优率的惊人事实。特别是在所有三种设定中,对于近专家数据集,LCB 实现了 1/N1/N 的更快速率,而非离线 RL 中通常的 1/N1/\sqrt{N} 速率,其中 NN 为批量数据集中的样本数。在至少含两个上下文的上下文_bandit 情形中,我们证明 LCB 对整个数据构成范围自适应最优,实现了从模仿学习到离线 RL 的平滑过渡。我们进一步表明 LCB 在 MDPs 中近乎自适应最优。

关键词

引用

@article{arxiv.2103.12021,
  title  = {Bridging Offline Reinforcement Learning and Imitation Learning: A Tale of Pessimism},
  author = {Paria Rashidinejad and Banghua Zhu and Cong Ma and Jiantao Jiao and Stuart Russell},
  journal= {arXiv preprint arXiv:2103.12021},
  year   = {2023}
}