结合时序差分评估的策略镜像下降的收敛性
最优化与控制
2025-09-24 v1 机器学习
摘要
策略镜像下降 (PMD) 是强化学习中的一种通用策略优化框架,通过指定不同的镜像映射可以涵盖广泛的典型策略优化方法。现有的 PMD 分析要求仅基于策略对动作值进行精确或近似评估(例如通过蒙特卡洛模拟进行无偏估计)。在本文中,我们考虑了结合时序差分评估的策略镜像下降 (TD-PMD)。结果表明,在能够获得精确策略评估的情况下,对于任意常数步长和任意初始化,TD-PMD 仍然保持与维度无关的 亚线性收敛。为了获得这一结果,我们开发了新的单调性和平移不变性论证。如果自适应地选择步长,我们还建立了 TD-PMD 与维度无关的 -速率线性收敛。对于 TD-PMD 的两个常见实例(即 TD-PQA 和 TD-NPG),进一步证明了它们在策略域中享有收敛性。此外,我们在非精确设定下研究了 TD-PMD,并给出了在生成模型下实现最后迭代 -最优性的样本复杂度,这改进了 PMD 最后迭代样本复杂度对 的依赖。
引用
@article{arxiv.2509.18822,
title = {On the Convergence of Policy Mirror Descent with Temporal Difference Evaluation},
author = {Jiacai Liu and Wenye Li and Ke Wei},
journal= {arXiv preprint arXiv:2509.18822},
year = {2025}
}