折扣马尔可夫决策过程中精确策略镜像下降的最优收敛速率
最优化与控制
2023-11-23 v3 机器学习
统计理论
统计理论
摘要
策略镜像下降(Policy Mirror Descent, PMD)是一类通用算法族,涵盖了强化学习中广泛的新颖与基础方法。受策略迭代(Policy Iteration, PI)在策略评估不精确时不稳定性的启发,PMD在算法上对PI的策略改进步骤进行了正则化。在精确策略评估下,已知PI以由马尔可夫决策过程的折扣因子给出的速率线性收敛。在本工作中,我们弥合了PI与具有精确策略评估的PMD之间的差距,并表明在无正则化PMD算法族在自适应步长下可以实现PI的无维度速率。我们表明该速率与步长对PMD而言均不可改进:我们提供了匹配的下界,证明速率对PMD方法以及PI是最优的,且自适应步长对PMD实现该速率是必要的。我们的工作是首个将PMD与速率最优性及步长必要性联系起来的研究。我们对PMD收敛性的研究避免了使用性能差异引理,从而带来了一个具有独立意义的直接分析。我们还将分析扩展到不精确设置,并在生成模型下建立了无正则化PMD的首个维度最优样本复杂度,改进了已知最佳结果。
引用
@article{arxiv.2302.11381,
title = {Optimal Convergence Rate for Exact Policy Mirror Descent in Discounted Markov Decision Processes},
author = {Emmeran Johnson and Ciara Pike-Burke and Patrick Rebeschini},
journal= {arXiv preprint arXiv:2302.11381},
year = {2023}
}
备注
Accepted at NeurIPS 2023