中文

MDP 中无折扣强化学习的方差感知后悔界

机器学习 2018-03-06 v1 机器学习 系统与控制

摘要

本文考虑在未知离散马尔可夫决策过程(MDP)中,于平均奖赏准则下的强化学习问题,此时学习器以单条观测流与系统交互,从初始状态出发且没有任何重置。我们通过以偏置函数的局部方差替代 MDP 的直径,重新审视该问题的极小极大下界。此外,我们对 KL-UCRL 算法给出了新的分析,针对遍历 MDP 建立了该算法的高概率后悔界,其尺度为 O~(Ss,aVs,aT)\widetilde {\mathcal O}\Bigl({\textstyle \sqrt{S\sum_{s,a}{\bf V}^\star_{s,a}T}}\Big),其中 SS 表示状态数,Vs,a{\bf V}^\star_{s,a} 为在状态 ss 下执行动作 aa 时关于下一状态分布的偏置函数方差。所得界改进了该算法此前最佳的已知后悔界 O~(DSAT)\widetilde {\mathcal O}(DS\sqrt{AT}),其中 AADD 分别表示(每状态的)最大动作数与 MDP 的直径。我们最后在一些基准 MDP 中比较了两种界的首项,表明所推导的界在某些情况下可带来数量级的改进。我们的分析利用了传输引理的新变体并结合 Kullback-Leibler 集中不等式,我们相信这些结果具有独立的意义。

关键词

引用

@article{arxiv.1803.01626,
  title  = {Variance-Aware Regret Bounds for Undiscounted Reinforcement Learning in MDPs},
  author = {Mohammad Sadegh Talebi and Odalric-Ambrym Maillard},
  journal= {arXiv preprint arXiv:1803.01626},
  year   = {2018}
}

备注

To appear in Proceedings of the 29th International Conference on Algorithmic Learning Theory (ALT 2018)