基于模型的RL作为无视界与二阶界的极简方法
机器学习
2024-10-30 v3
摘要
通过最大似然估计(Maximum Likelihood Estimation, MLE)学习转移模型,然后在学习到的模型中进行规划,可能是最标准且最简单的基于模型的强化学习(Model-based Reinforcement Learning, RL)框架。在本文中,我们证明了这种简单的基于模型的RL方案,在配备乐观和悲观规划程序后,能够在在线和离线RL设置中取得较强的遗憾(regret)和样本复杂度(sample complexity)界。特别地,我们证明在轨迹奖励归一化在零和一之间且转移是时齐的条件下,该方法实现了近似无视界(nearly horizon-free)和二阶界(second-order bounds)。近似无视界意味着我们的界对马尔可夫决策过程(Markov Decision Process)的视界没有多项式依赖。二阶界是一种实例依赖(instance-dependent)的界,其尺度随策略回报的方差而变化,当系统接近确定性且(或)最优策略取值较小时,该方差可能较小。我们强调,我们的算法简单、相当标准,且确实已在RL文献中被广泛研究:它们通过MLE学习模型,在MLE解周围构建版本空间(version space),并根据是在线还是离线模式运行而执行乐观或悲观规划。这些算法不依赖额外的专门算法设计(如学习方差和执行方差加权学习),因此可以轻松利用非线性函数近似。算法的简洁性也意味着我们的无视界和二阶遗憾分析实际上是标准的,主要遵循不确定性下的乐观/悲观的一般框架。
引用
@article{arxiv.2408.08994,
title = {Model-based RL as a Minimalist Approach to Horizon-Free and Second-Order Bounds},
author = {Zhiyong Wang and Dongruo Zhou and John C. S. Lui and Wen Sun},
journal= {arXiv preprint arXiv:2408.08994},
year = {2024}
}