中文

面向非平稳马尔可夫决策过程的强化学习:乐观(更多)之赐

机器学习 2020-06-26 v1 机器学习

摘要

我们考虑漂移非平稳下马尔可夫决策过程 (MDPs) 中的无折扣强化学习 (RL),即只要奖励与状态转移分布各自的适宜度量下总变差不超过特定变化预算,便允许其随时间演化。我们首先开发了带置信增宽的强化学习滑动窗口上置信界 (SWUCRL2-CW) 算法,并在变化预算已知时建立其动态后悔界。此外,我们提出强化学习上的 Bandit (BORL) 算法,以无参数方式自适应地调谐 SWUCRL2-CW 算法,从而实现相同的动态后悔界,即无需知道变化预算。值得注意的是,通过传统乐观探索技术学习非平稳 MDP 存在一个现有(非平稳)Bandit 学习设定中不存在的独特挑战。我们通过一种融入额外乐观的新颖置信增宽技术克服了该挑战。

关键词

引用

@article{arxiv.2006.14389,
  title  = {Reinforcement Learning for Non-Stationary Markov Decision Processes: The Blessing of (More) Optimism},
  author = {Wang Chi Cheung and David Simchi-Levi and Ruihao Zhu},
  journal= {arXiv preprint arXiv:2006.14389},
  year   = {2020}
}

备注

To appear in proceedings of the 37th International Conference on Machine Learning. Shortened conference version of its journal version (available at: arXiv:1906.02922)