一种用于马尔可夫决策过程的高斯-牛顿方法
人工智能
2015-08-07 v4 机器学习
机器学习
摘要
近似牛顿法是一种标准优化工具,旨在保持牛顿法的优点(如快速收敛速率),同时缓解其缺点(如计算昂贵的逆Hessian计算或估计)。本工作中,我们研究马尔可夫决策过程(MDPs)中用于策略优化的近似牛顿法。我们首先分析了MDPs目标函数的Hessian结构。我们表明,像梯度一样,Hessian在MDPs背景下展现出有用的结构,并利用该分析推导出两种用于MDPs的高斯-牛顿方法。类似于非线性最小二乘的高斯-牛顿法,这些方法通过忽略Hessian中难以估计的某些项来近似Hessian。近似Hessian具有理想性质,如负定性,并且我们展示了若干重要的性能保证,包括保证的上升方向、对参数空间仿射变换的不变性以及收敛保证。最后,我们提供了关键策略搜索算法的统一视角,证明我们的第二种高斯-牛顿算法与应用于MDPs的EM算法和自然梯度上升密切相关,但在一系列具有挑战性的领域上实践中表现显著更好。
引用
@article{arxiv.1507.08271,
title = {A Gauss-Newton Method for Markov Decision Processes},
author = {Thomas Furmston and Guy Lever},
journal= {arXiv preprint arXiv:1507.08271},
year = {2015}
}