基于世界模型的低方差策略梯度估计
机器学习
2020-10-30 v1 人工智能
机器学习
摘要
本文提出世界模型策略梯度(WMPG),一种利用习得世界模型(WM)降低策略梯度估计方差的方法。在 WMPG 中,WM 在线训练并用于想象轨迹。想象轨迹以两种方式使用:其一,计算策略梯度的无放回估计量;其二,将想象轨迹的回报用作知情基线。我们在复杂度递增的一组环境(CartPole、LunarLander 与 Pong)上将所提方法与 AC 和 MAC 比较,发现 WMPG 具有更优样本效率。基于这些结果,我们得出结论:在可习得鲁棒环境潜表示的情况下,WMPG 能带来更高的样本效率。
引用
@article{arxiv.2010.15622,
title = {Low-Variance Policy Gradient Estimation with World Models},
author = {Michal Nauman and Floris Den Hengst},
journal= {arXiv preprint arXiv:2010.15622},
year = {2020}
}