中文

基于世界模型的低方差策略梯度估计

机器学习 2020-10-30 v1 人工智能 机器学习

摘要

本文提出世界模型策略梯度(WMPG),一种利用习得世界模型(WM)降低策略梯度估计方差的方法。在 WMPG 中,WM 在线训练并用于想象轨迹。想象轨迹以两种方式使用:其一,计算策略梯度的无放回估计量;其二,将想象轨迹的回报用作知情基线。我们在复杂度递增的一组环境(CartPole、LunarLander 与 Pong)上将所提方法与 AC 和 MAC 比较,发现 WMPG 具有更优样本效率。基于这些结果,我们得出结论:在可习得鲁棒环境潜表示的情况下,WMPG 能带来更高的样本效率。

关键词

引用

@article{arxiv.2010.15622,
  title  = {Low-Variance Policy Gradient Estimation with World Models},
  author = {Michal Nauman and Floris Den Hengst},
  journal= {arXiv preprint arXiv:2010.15622},
  year   = {2020}
}