深度贝叶斯求积策略优化
机器学习
2020-12-17 v3 机器学习
摘要
我们研究了利用有限数量样本获得准确策略梯度估计的问题。尽管蒙特卡洛方法在梯度估计中存在高方差的问题,但其一直是策略梯度估计的默认选择。另一方面,诸如贝叶斯求积等更具样本效率的替代方法由于其高计算复杂度而很少受到关注。在这项工作中,我们提出了深度贝叶斯求积策略梯度(DBQPG),一种计算高效的高维贝叶斯求积推广,用于策略梯度估计。我们表明 DBQPG 可以替代策略梯度方法中的蒙特卡洛估计,并在一组连续控制基准上展示了其有效性。与蒙特卡洛估计相比,DBQPG 提供了(i)方差显著更低的更准确梯度估计,(ii)若干深度策略梯度算法在样本复杂度和平均回报上的一致改进,以及(iii)梯度估计中的不确定性,该不确定性可被纳入以进一步提升性能。
引用
@article{arxiv.2006.15637,
title = {Deep Bayesian Quadrature Policy Optimization},
author = {Akella Ravi Tej and Kamyar Azizzadenesheli and Mohammad Ghavamzadeh and Anima Anandkumar and Yisong Yue},
journal= {arXiv preprint arXiv:2006.15637},
year = {2020}
}
备注
Conference paper: AAAI-21. Code available at https://github.com/Akella17/Deep-Bayesian-Quadrature-Policy-Optimization