中文

策略梯度方法的算子视角

机器学习 2020-10-26 v3 人工智能 机器学习

摘要

我们将策略梯度方法视为两个算子的重复应用:一个策略改进算子 I\mathcal{I},它将任意策略 π\pi 映射为更好的策略 Iπ\mathcal{I}\pi;以及一个投影算子 P\mathcal{P},它在可实现策略集中找到 Iπ\mathcal{I}\pi 的最佳近似。我们利用该框架引入传统策略梯度方法(如 REINFORCE 和 PPO)的基于算子的版本,从而更好地理解其原始对应方法。我们还利用对所开发的 I\mathcal{I}P\mathcal{P} 作用的理解,提出期望回报的一个新的全局下界。这一新视角使我们进一步弥合基于策略与基于价值的方法之间的差距,例如展示 REINFORCE 与 Bellman 最优算子如何可被视为同一枚硬币的两面。

关键词

引用

@article{arxiv.2006.11266,
  title  = {An operator view of policy gradient methods},
  author = {Dibya Ghosh and Marlos C. Machado and Nicolas Le Roux},
  journal= {arXiv preprint arXiv:2006.11266},
  year   = {2020}
}

备注

NeurIPS 2020