低秩马尔可夫决策过程中可证明高效的表示选择:从在线到离线强化学习
机器学习
2024-02-15 v2 最优化与控制
机器学习
摘要
深度强化学习(DRL)的成功在于其能够学习适于探索与利用任务的表示。为理解表示的选择如何提升强化学习(RL)的效率,我们研究一类低秩马尔可夫决策过程(MDPs)的表示选择,其中转移核可用双线性形式表示。我们提出一种高效算法 ReLEX,用于在线与离线 RL 中的表示学习。具体而言,我们证明 ReLEX 的在线版本 ReLEX-UCB 始终不差于无表示选择的最先进算法,且若表示函数类在整个状态-动作空间上具有“覆盖”性质,则实现严格更优的常数后悔界。对于离线对应算法 ReLEX-LCB,我们证明若表示类能覆盖状态-动作空间,该算法可找到最优策略,并实现依赖于间隙的样本复杂度。这是离线 RL 表示学习中首个具有常数样本复杂度的结果。
引用
@article{arxiv.2106.11935,
title = {Provably Efficient Representation Selection in Low-rank Markov Decision Processes: From Online to Offline RL},
author = {Weitong Zhang and Jiafan He and Dongruo Zhou and Amy Zhang and Quanquan Gu},
journal= {arXiv preprint arXiv:2106.11935},
year = {2024}
}
备注
32 pages, 2 figures, 7 tables, In UAI 2023