面向一般状态与动作空间的有限时序MDP策略优化的景观
最优化与控制
2026-03-10 v2 机器学习
摘要
策略梯度方法在强化学习中广泛应用。然而,策略优化的非凸性在理解策略梯度方法的全局收敛性方面 presents significant挑战。对于一类具有一般状态和动作空间的有限时序马尔可夫决策过程(MDPs),我们识别出一组结构性属性,以建立策略优化的良好非凸景观,即多边形阿尔乔斯-维尔斯icz-库尔斯基条件(Polyak-{\L}ojasiewicz-Kurdyka, P{\L}K condition)。凭借P{\L}K条件,策略梯度方法能够以非渐近速率收敛到全局最优策略,尽管存在非凸性。我们的结果适用于各种控制和运营模型,包括熵正则化的表格MDP、线性二次型控制器(LQR)问题,以及具有强凸代价的随机库存模型和随机现金平衡问题。在这些模型中,随机策略梯度方法使用样本量为即可获得-最优策略。到目前为止,我们提供了针对马尔可夫调制需求的多期库存系统和随机现金平衡问题的首个样本复杂度保证。我们通过数值实验补充了理论,表明在这些运营模型中,策略梯度方法在多个基准算法上均表现出色。
引用
@article{arxiv.2409.17138,
title = {Landscape of Policy Optimization for Finite Horizon MDPs with General State and Action},
author = {Xin Chen and Yifan Hu and Minda Zhao},
journal= {arXiv preprint arXiv:2409.17138},
year = {2026}
}