MDP 中无折扣强化学习的方差感知后悔界
机器学习
2018-03-06 v1 机器学习
系统与控制
摘要
本文考虑在未知离散马尔可夫决策过程(MDP)中,于平均奖赏准则下的强化学习问题,此时学习器以单条观测流与系统交互,从初始状态出发且没有任何重置。我们通过以偏置函数的局部方差替代 MDP 的直径,重新审视该问题的极小极大下界。此外,我们对 KL-UCRL 算法给出了新的分析,针对遍历 MDP 建立了该算法的高概率后悔界,其尺度为 ,其中 表示状态数, 为在状态 下执行动作 时关于下一状态分布的偏置函数方差。所得界改进了该算法此前最佳的已知后悔界 ,其中 和 分别表示(每状态的)最大动作数与 MDP 的直径。我们最后在一些基准 MDP 中比较了两种界的首项,表明所推导的界在某些情况下可带来数量级的改进。我们的分析利用了传输引理的新变体并结合 Kullback-Leibler 集中不等式,我们相信这些结果具有独立的意义。
引用
@article{arxiv.1803.01626,
title = {Variance-Aware Regret Bounds for Undiscounted Reinforcement Learning in MDPs},
author = {Mohammad Sadegh Talebi and Odalric-Ambrym Maillard},
journal= {arXiv preprint arXiv:1803.01626},
year = {2018}
}
备注
To appear in Proceedings of the 29th International Conference on Algorithmic Learning Theory (ALT 2018)