大规模马尔可夫决策过程的非精确 GMRES 策略迭代
最优化与控制
2022-11-09 v1
摘要
策略迭代具有局部二次收缩率,但对于具有大量状态的马尔可夫决策过程(MDPs),其迭代计算成本高昂。鉴于策略迭代与半光滑牛顿法之间的联系,并受后者非精确变体的启发,我们提出了“非精确策略迭代”,这是一类针对大规模有限 MDP 的新方法,具有局部收缩保证。随后,我们设计了一个基于在近似策略评估步骤中部署 GMRES 的实例,称之为非精确 GMRES 策略迭代。最后,我们在一个具有 10000 个状态的 MDP 上展示了非精确 GMRES 策略迭代的优越实际性能,相较于策略迭代和乐观策略迭代,它分别实现了 和 的加速。
引用
@article{arxiv.2211.04299,
title = {Inexact GMRES Policy Iteration for Large-Scale Markov Decision Processes},
author = {Matilde Gargiani and Dominic Liao-McPherson and Andrea Zanelli and John Lygeros},
journal= {arXiv preprint arXiv:2211.04299},
year = {2022}
}