中文

低秩 MDP 中在线与离线强化学习的表示学习

机器学习 2022-01-07 v3 人工智能 机器学习

摘要

本研究探讨强化学习中的表示学习问题:如何学习一种紧凑的低维表示,使得在该表示之上能够以样本高效的方式执行探索与利用等 RL 过程。我们关注低秩马尔可夫决策过程(MDP),其转移动力学对应于一个低秩转移矩阵。与先前假设表示已知(如线性 MDP)的工作不同,此处我们需要为低秩 MDP 学习表示。我们研究了在线 RL 与离线 RL 两种设定。对于在线设定,在使用与 FLAMBE(Agarwal 等人,低秩 MDP 中表示学习的最优算法)相同的计算预言机下,我们提出一种算法 REP-UCB(Upper Confidence Bound driven Representation learning for RL,基于上置信界驱动的 RL 表示学习),其将样本复杂度从 FLAMBE 的 O~(A9d7/(ϵ10(1γ)22))\widetilde{O}( A^9 d^7 / (\epsilon^{10} (1-\gamma)^{22})) 显著改进至 O~(A2d4/(ϵ2(1γ)5))\widetilde{O}( A^2 d^4 / (\epsilon^2 (1-\gamma)^{5}) ),其中 dd 为转移矩阵的秩(或真实表示的维度),AA 为动作数,γ\gamma 为折扣因子。值得注意的是,REP-UCB 比 FLAMBE 更简单,因为它直接平衡表示学习、探索与利用之间的相互作用,而 FLAMBE 是一种先探索后提交的风格方法,必须按时间步向前执行无奖励探索。对于离线 RL 设定,我们开发了一种利用悲观主义在部分覆盖条件下进行学习的算法:只要某策略被离线分布所覆盖,我们的算法就能与之竞争。

关键词

引用

@article{arxiv.2110.04652,
  title  = {Representation Learning for Online and Offline RL in Low-rank MDPs},
  author = {Masatoshi Uehara and Xuezhou Zhang and Wen Sun},
  journal= {arXiv preprint arXiv:2110.04652},
  year   = {2022}
}