傅里叶策略梯度
机器学习
2018-05-31 v2 人工智能
摘要
我们提出了一种推导强化学习策略梯度更新的新方法。我们的技术基于傅里叶分析,将期望策略梯度中出现的积分重新表述为卷积并转化为乘法。所获得的解析解使我们能够在广泛设置中捕获 EPG 的低方差优势。对于评论家,我们处理三角函数和径向基函数,这两个具有通用逼近性质的函数族。策略的选择几乎可以是任意的,包括混合或连续-离散混合概率分布。此外,我们推导了随机策略梯度的基于样本估计器的一般族,统一了关于基于样本逼近的现有结果。我们相信该技术有潜力塑造由解析结果驱动的下一代策略梯度方法。
引用
@article{arxiv.1802.06891,
title = {Fourier Policy Gradients},
author = {Matthew Fellows and Kamil Ciosek and Shimon Whiteson},
journal= {arXiv preprint arXiv:1802.06891},
year = {2018}
}