中文

基于方差缩减的部分轨迹复用以加速策略梯度优化

机器学习 2022-06-22 v2

摘要

基于我们此前关于面向轨迹复用绿色仿真辅助策略梯度(GS-PG)的研究,本文考虑无限 horizon 马尔可夫决策过程,并创建一种基于重要性采样的新型策略梯度优化方法以支持动态决策。现有 GS-PG 方法被设计为从完整回合或过程轨迹中学习,这限制了其在低数据情境和灵活在线过程控制中的适用性。为克服该局限,所提方法可有选择地复用最相关的部分轨迹,即复用单元基于单步或单决策的历史观测。具体而言,我们创建了基于混合似然比(MLR)的策略梯度优化,可利用不同行为策略下生成的历史状态-动作转移信息。所提方差缩减经验回放(VRER)方法可智能选择并复用最相关的转移观测,改进策略梯度估计,并加速最优策略的学习。我们的实证研究表明,该方法可改善优化收敛性并提升诸如 actor-critic 方法和近端策略优化等最先进策略优化方法的性能。

关键词

引用

@article{arxiv.2205.02976,
  title  = {Variance Reduction based Partial Trajectory Reuse to Accelerate Policy Gradient Optimization},
  author = {Hua Zheng and Wei Xie},
  journal= {arXiv preprint arXiv:2205.02976},
  year   = {2022}
}

备注

12 pages, 5 figures