中文

大规模马尔可夫决策过程的非精确 GMRES 策略迭代

最优化与控制 2022-11-09 v1

摘要

策略迭代具有局部二次收缩率,但对于具有大量状态的马尔可夫决策过程(MDPs),其迭代计算成本高昂。鉴于策略迭代与半光滑牛顿法之间的联系,并受后者非精确变体的启发,我们提出了“非精确策略迭代”,这是一类针对大规模有限 MDP 的新方法,具有局部收缩保证。随后,我们设计了一个基于在近似策略评估步骤中部署 GMRES 的实例,称之为非精确 GMRES 策略迭代。最后,我们在一个具有 10000 个状态的 MDP 上展示了非精确 GMRES 策略迭代的优越实际性能,相较于策略迭代和乐观策略迭代,它分别实现了 ×5.8\times 5.8×2.2\times 2.2 的加速。

关键词

引用

@article{arxiv.2211.04299,
  title  = {Inexact GMRES Policy Iteration for Large-Scale Markov Decision Processes},
  author = {Matilde Gargiani and Dominic Liao-McPherson and Andrea Zanelli and John Lygeros},
  journal= {arXiv preprint arXiv:2211.04299},
  year   = {2022}
}