中文

低秩马尔可夫决策过程中可证明高效的表示选择:从在线到离线强化学习

机器学习 2024-02-15 v2 最优化与控制 机器学习

摘要

深度强化学习(DRL)的成功在于其能够学习适于探索与利用任务的表示。为理解表示的选择如何提升强化学习(RL)的效率,我们研究一类低秩马尔可夫决策过程(MDPs)的表示选择,其中转移核可用双线性形式表示。我们提出一种高效算法 ReLEX,用于在线与离线 RL 中的表示学习。具体而言,我们证明 ReLEX 的在线版本 ReLEX-UCB 始终不差于无表示选择的最先进算法,且若表示函数类在整个状态-动作空间上具有“覆盖”性质,则实现严格更优的常数后悔界。对于离线对应算法 ReLEX-LCB,我们证明若表示类能覆盖状态-动作空间,该算法可找到最优策略,并实现依赖于间隙的样本复杂度。这是离线 RL 表示学习中首个具有常数样本复杂度的结果。

关键词

引用

@article{arxiv.2106.11935,
  title  = {Provably Efficient Representation Selection in Low-rank Markov Decision Processes: From Online to Offline RL},
  author = {Weitong Zhang and Jiafan He and Dongruo Zhou and Amy Zhang and Quanquan Gu},
  journal= {arXiv preprint arXiv:2106.11935},
  year   = {2024}
}

备注

32 pages, 2 figures, 7 tables, In UAI 2023