动态策略规划
机器学习
2011-09-09 v2 人工智能
系统与控制
最优化与控制
机器学习
摘要
在本文中,我们提出了一种新的策略迭代方法,称为动态策略规划(DPP),用于估计无限视界马尔可夫决策过程中的最优策略。我们证明了在存在近似/估计误差的情况下,DPP 的有限迭代与渐近 l\infty-范数性能损失界限。与标准近似值迭代(AVI)和近似策略迭代(API)情况下的误差 l\infty-范数不同,这些界限是用平均累积误差的 l\infty-范数表示的。这表明 DPP 能够取得比 AVI 和 API 更好的性能,因为它在整个学习过程中平均化了由蒙特卡洛采样引起的模拟噪声。我们通过在不同问题领域比较 DPP 的近似变体与现有强化学习(RL)方法的性能,对这些理论结果进行了数值检验。我们的结果表明,在所有情况下,基于 DPP 的算法均以大幅优势优于其他 RL 方法。
引用
@article{arxiv.1004.2027,
title = {Dynamic Policy Programming},
author = {Mohammad Gheshlaghi Azar and Vicenc Gomez and Hilbert J. Kappen},
journal= {arXiv preprint arXiv:1004.2027},
year = {2011}
}
备注
Submitted to Journal of Machine Learning Research