中文

非平稳低秩 MDP 的可证明高效算法

机器学习 2023-08-11 v1

摘要

变化环境下的强化学习(RL)通过非平稳马尔可夫决策过程(MDP)对许多现实应用进行建模,因此受到相当关注。然而,文献中关于非平稳 MDP 的理论研究主要集中在表格型和线性(混合)MDP 上,未能刻画深度 RL 中未知表示的性质。本文首次研究 episodic 低秩 MDP 下的非平稳 RL,其中转移核与奖励均可随时间变化,且低秩模型除线性状态嵌入函数外还包含未知表示。我们首先提出一种称为 PORTAL 的参数依赖策略优化算法,并进一步将其改进为无参数版本 Ada-PORTAL,该版本能够在无任何非平稳性先验知识的情况下自适应地调节超参数。对于两种算法,我们给出了平均动态次优间隙的上界,表明只要非平稳性不是特别大,PORTAL 与 Ada-PORTAL 就具有样本高效性,并能以多项式样本复杂度实现任意小的平均动态次优间隙。

关键词

引用

@article{arxiv.2308.05471,
  title  = {Provably Efficient Algorithm for Nonstationary Low-Rank MDPs},
  author = {Yuan Cheng and Jing Yang and Yingbin Liang},
  journal= {arXiv preprint arXiv:2308.05471},
  year   = {2023}
}