中文

关于生成模型下强化学习的样本复杂度

机器学习 2012-07-03 v1 机器学习

摘要

我们考虑在折扣奖励马尔可夫决策过程(MDP)中学习最优动作价值函数的问题。我们证明了在生成模型存在的情况下,基于模型的值迭代算法的一个新的PAC样本复杂度界,该界表明:对于一个具有NN个状态-动作对和折扣因子γ[0,1)\gamma\in[0,1)的MDP,仅需O(Nlog(N/δ)/((1γ)3ϵ2))O(N\log(N/\delta)/((1-\gamma)^3\epsilon^2))个样本即可以概率1δ1-\delta找到动作价值函数的ϵ\epsilon-最优估计。我们还证明了每个强化学习算法在估计最优动作价值函数时的样本复杂度的一个匹配下界Θ(Nlog(N/δ)/((1γ)3ϵ2))\Theta (N\log(N/\delta)/((1-\gamma)^3\epsilon^2))。据我们所知,这是关于估计最优(动作)价值函数的样本复杂度的首个匹配结果,其中上界在NNϵ\epsilonδ\delta1/(1γ)1/(1-\gamma)方面与强化学习的下界相匹配。此外,我们的下界和上界在1/(1γ)1/(1-\gamma)方面都显著改进了现有技术水平。

关键词

引用

@article{arxiv.1206.6461,
  title  = {On the Sample Complexity of Reinforcement Learning with a Generative Model},
  author = {Mohammad Gheshlaghi Azar and Remi Munos and Bert Kappen},
  journal= {arXiv preprint arXiv:1206.6461},
  year   = {2012}
}

备注

Appears in Proceedings of the 29th International Conference on Machine Learning (ICML 2012)