基于随机镜像下降的策略优化
机器学习
2022-02-10 v5 机器学习
摘要
提高样本效率一直是强化学习中的长期目标。本文提出 算法:一种基于随机镜像下降的样本高效策略梯度方法。在 中,提出了一种新颖的方差缩减策略梯度估计量以提升样本效率。我们证明所提出的 仅需 条样本轨迹即可达到 -近似一阶平稳点,这与策略优化的最佳样本复杂度相匹配。大量实验结果表明, 在各种设置下均优于最先进的策略梯度方法。
引用
@article{arxiv.1906.10462,
title = {Policy Optimization with Stochastic Mirror Descent},
author = {Long Yang and Yu Zhang and Gang Zheng and Qian Zheng and Pengfei Li and Jianhang Huang and Jun Wen and Gang Pan},
journal= {arXiv preprint arXiv:1906.10462},
year = {2022}
}