具有前瞻的策略镜像下降
机器学习
2024-11-07 v3 人工智能
机器学习
摘要
策略镜像下降作为一个通用的算法框架,包含了自然策略梯度等多种经典的策略梯度算法,并与 TRPO 和 PPO 等最先进的强化学习算法存在联系。PMD 可以被视为一种实现正则化 1 步贪婪策略改进的软策略迭代算法。然而,1 步贪婪策略可能不是最佳选择,且强化学习中近期显著的经验成功(如 AlphaGo 和 AlphaZero)已经证明,基于多步的贪婪方法优于其 1 步对应方法。在本工作中,我们提出了一类新的 PMD 算法,称为 -PMD,它将具有前瞻深度 的多步贪婪策略改进结合到 PMD 更新规则中。为了求解折扣因子为 的折扣无限时域马尔可夫决策过程,我们证明了推广标准 PMD 的 -PMD 享有更快的无维度 线性收敛速率,这取决于多步贪婪策略的计算。我们提出了一个 -PMD 的非精确版本,其中前瞻动作值是被估计的。在生成模型下,我们建立了 -PMD 的样本复杂度,该复杂度优于先前的工作。最后,我们将结果扩展到线性函数近似,以扩展到大型状态空间。在适当的假设下,我们的样本复杂度仅依赖于特征图空间的维度,而不依赖于状态空间的大小。
引用
@article{arxiv.2403.14156,
title = {Policy Mirror Descent with Lookahead},
author = {Kimon Protopapas and Anas Barakat},
journal= {arXiv preprint arXiv:2403.14156},
year = {2024}
}