兼容自然梯度策略搜索
机器学习
2019-02-11 v1 机器学习
摘要
信赖域方法在策略搜索中取得了最先进的结果。一种常见方法是使用KL散度来界定信赖域,从而得到自然梯度策略更新。我们证明,若我们对标准指数策略分布使用自然参数化并结合兼容值函数逼近,则自然梯度与信赖域优化是等价的。此外,我们表明标准的自然梯度更新可能按照错误的调度降低策略熵,导致过早收敛。为控制熵减,我们引入了一种称为兼容策略搜索(COPOS)的新策略搜索方法,其对熵损失进行界定。实验结果表明,COPOS在具有挑战性的连续控制任务和离散部分可观测任务中均取得了最先进的结果。
引用
@article{arxiv.1902.02823,
title = {Compatible Natural Gradient Policy Search},
author = {Joni Pajarinen and Hong Linh Thai and Riad Akrour and Jan Peters and Gerhard Neumann},
journal= {arXiv preprint arXiv:1902.02823},
year = {2019}
}