直接策略梯度:离散动作空间中策略的直接优化
机器学习
2020-10-26 v2 人工智能
机器学习
摘要
直接优化是一种引人注目的框架,它用对随机目标的优化替代积分,以近似含离散随机变量的模型中的梯度。A 采样是一种在大型空间上优化此类随机目标的框架。我们展示如何结合这些技术以产生一种强化学习算法,该算法通过寻找优化随机目标的轨迹来近似策略梯度。我们称所得算法为“直接策略梯度”(DirPG)算法。DirPG 算法的一个主要好处是允许以训练时回报上限(类似启发式搜索中所用)的形式插入领域知识,同时仍直接计算策略梯度。我们进一步分析其性质,表明在某些情况下 DirPG 相比 REINFORCE 采样到信息性梯度的概率呈指数级更大。我们还展示其内置方差缩减技术,且先前被视为数值近似的参数可解释为控制风险敏感性。在经验上,我们评估关键自由度的效果,并表明该算法在示例性领域相较基线表现良好。
引用
@article{arxiv.1906.06062,
title = {Direct Policy Gradients: Direct Optimization of Policies in Discrete Action Spaces},
author = {Guy Lorberbom and Chris J. Maddison and Nicolas Heess and Tamir Hazan and Daniel Tarlow},
journal= {arXiv preprint arXiv:1906.06062},
year = {2020}
}