大规模马尔可夫决策过程的不精确策略迭代方法
最优化与控制
2024-04-10 v1
摘要
我们考虑大规模有限空间无限时域折扣MDP的不精确策略迭代方法,这是策略迭代的一种变体,其中策略评估步骤使用线性系统的迭代求解器不精确地实现。在经典动态规划文献中,类似的原理被部署在乐观策略迭代中,其中使用固定次数的值迭代来不精确地求解策略评估步骤。受策略迭代与半光滑牛顿法之间联系的启发,我们研究了一类iPI方法,这些方法通过采用参数化停止条件来调节策略评估步骤的不精确程度,模仿半光滑牛顿法的不精确变体。对于这类方法,我们讨论了局部和全局收敛性质,并推导了提供收缩保证的停止条件参数的实际取值范围。我们的分析是通用的,因此涵盖了各种策略评估的迭代求解器,包括标准值迭代以及更复杂的求解器如GMRES。正如我们的分析所强调的,内层求解器的选择对于整体方法的性能至关重要。因此,我们考虑了不同的迭代方法来求解策略评估步骤,并分析了它们在用于策略评估时的适用性和收缩性质。我们表明,这些方法的收缩性质往往因策略评估的具体结构而增强,并且在收敛速度方面有显著改进的空间。最后,我们研究了不精确策略迭代的不同实例在大规模MDP上的数值性能,这些MDP用于设计流行病学中控制传染病传播的健康政策。
引用
@article{arxiv.2404.06136,
title = {Inexact Policy Iteration Methods for Large-Scale Markov Decision Processes},
author = {Matilde Gargiani and Robin Sieber and Efe Balta and Dominic Liao-McPherson and John Lygeros},
journal= {arXiv preprint arXiv:2404.06136},
year = {2024}
}