结构至关重要:动态策略梯度
机器学习
2024-11-08 v1 最优化与控制
概率论
摘要
在本工作中,我们研究 -折扣无限时间范围表格马尔可夫决策过程(MDP),并提出一个名为动态策略梯度(DynPG)的框架。该框架将动态规划与(任意)策略梯度方法直接整合,明确利用环境的马尔可夫性质。DynPG 在训练过程中动态调整问题时间范围,将原始无限时间范围 MDP 分解为一系列上下文多臂赌博机问题。通过迭代求解这些上下文多臂赌博机,DynPG 收敛到无限时间范围 MDP 的平稳最优策略。为了展示 DynPG 的能力,我们在表格 softmax 参数化下建立了其非渐近全局收敛率,重点关注 MDP 中显著但关键的参数依赖关系。通过将动态规划的经典论证与策略梯度方案的近期收敛论证相结合,我们证明了 softmax DynPG 在有效时间范围 上呈多项式缩放。我们的发现与 vanilla 策略梯度的近期指数下界示例形成对比。
引用
@article{arxiv.2411.04913,
title = {Structure Matters: Dynamic Policy Gradient},
author = {Sara Klein and Xiangyuan Zhang and Tamer Başar and Simon Weissmann and Leif Döring},
journal= {arXiv preprint arXiv:2411.04913},
year = {2024}
}
备注
46 pages, 4 figures