具有形式化学习时间保证的增量式基于模型的学习器
机器学习
2012-07-02 v1 人工智能
机器学习
摘要
基于模型的学习算法在学习求解具有有限状态和动作空间的 Markov Decision Processes (MDPs) 时,已被证明能够有效地利用经验。然而,由于反复求解内部模型而导致的高计算成本阻碍了它们在大规模问题中的应用。我们提出了一种基于实时动态规划(RTDP)的方法来加速两种基于模型的算法 RMAX 和 MBIE(基于模型的区间估计),从而得到计算上更快的算法,且与现有界限相比几乎没有损失。具体而言,我们的两种新学习算法 RTDP-RMAX 和 RTDP-IE 的计算需求明显小于 RMAX 和 MBIE。我们开发了一个通用理论框架,使我们能够证明两者在 PAC(概率近似正确)意义上都是高效的学习器。我们还对这些新算法进行了实验评估,以帮助量化计算需求与经验需求之间的权衡。
引用
@article{arxiv.1206.6870,
title = {Incremental Model-based Learners With Formal Learning-Time Guarantees},
author = {Alexander L. Strehl and Lihong Li and Michael L. Littman},
journal= {arXiv preprint arXiv:1206.6870},
year = {2012}
}
备注
Appears in Proceedings of the Twenty-Second Conference on Uncertainty in Artificial Intelligence (UAI2006)