基于共轭策略的策略梯度方法多样化探索
机器学习
2019-02-12 v1 机器学习
摘要
我们探讨了在策略梯度方法中保持良好性能的同时进行有效探索的挑战。作为一种解决方案,我们提出了基于共轭策略的多样化探索(DE)。DE 学习并部署一组共轭策略,这些策略可以作为共轭梯度下降的副产品被方便地生成。我们提供了理论和实证结果,表明 DE 在实现探索和改善策略性能方面的有效性,以及 DE 相对于随机策略扰动探索的优势。
引用
@article{arxiv.1902.03633,
title = {Diverse Exploration via Conjugate Policies for Policy Gradient Methods},
author = {Andrew Cohen and Xingye Qiao and Lei Yu and Elliot Way and Xiangrong Tong},
journal= {arXiv preprint arXiv:1902.03633},
year = {2019}
}
备注
AAAI 2019