中文

基于随机镜像下降的策略优化

机器学习 2022-02-10 v5 机器学习

摘要

提高样本效率一直是强化学习中的长期目标。本文提出 VRMPO\mathtt{VRMPO} 算法:一种基于随机镜像下降的样本高效策略梯度方法。在 VRMPO\mathtt{VRMPO} 中,提出了一种新颖的方差缩减策略梯度估计量以提升样本效率。我们证明所提出的 VRMPO\mathtt{VRMPO} 仅需 O(ϵ3)\mathcal{O}(\epsilon^{-3}) 条样本轨迹即可达到 ϵ\epsilon-近似一阶平稳点,这与策略优化的最佳样本复杂度相匹配。大量实验结果表明, VRMPO\mathtt{VRMPO} 在各种设置下均优于最先进的策略梯度方法。

关键词

引用

@article{arxiv.1906.10462,
  title  = {Policy Optimization with Stochastic Mirror Descent},
  author = {Long Yang and Yu Zhang and Gang Zheng and Qian Zheng and Pengfei Li and Jianhang Huang and Jun Wen and Gang Pan},
  journal= {arXiv preprint arXiv:1906.10462},
  year   = {2022}
}