关于生成模型下强化学习的样本复杂度
机器学习
2012-07-03 v1 机器学习
摘要
我们考虑在折扣奖励马尔可夫决策过程(MDP)中学习最优动作价值函数的问题。我们证明了在生成模型存在的情况下,基于模型的值迭代算法的一个新的PAC样本复杂度界,该界表明:对于一个具有个状态-动作对和折扣因子的MDP,仅需个样本即可以概率找到动作价值函数的-最优估计。我们还证明了每个强化学习算法在估计最优动作价值函数时的样本复杂度的一个匹配下界。据我们所知,这是关于估计最优(动作)价值函数的样本复杂度的首个匹配结果,其中上界在、、和方面与强化学习的下界相匹配。此外,我们的下界和上界在方面都显著改进了现有技术水平。
引用
@article{arxiv.1206.6461,
title = {On the Sample Complexity of Reinforcement Learning with a Generative Model},
author = {Mohammad Gheshlaghi Azar and Remi Munos and Bert Kappen},
journal= {arXiv preprint arXiv:1206.6461},
year = {2012}
}
备注
Appears in Proceedings of the 29th International Conference on Machine Learning (ICML 2012)