中文

用于深度强化学习的可微信任域层

机器学习 2021-03-10 v2 信息论 math.IT

摘要

信任域方法是强化学习中一种流行的工具,因为它们在连续和离散动作空间中产生稳健的策略更新。然而,在深度强化学习中实施此类信任域是困难的。因此,许多方法,如信任域策略优化(TRPO)和近端策略优化(PPO),都基于近似。由于这些近似,它们违反了约束或未能在信任域内找到最优解。此外,它们难以实现,常常缺乏充分的探索,并且已被证明依赖于看似无关的实现选择。在这项工作中,我们提出可微神经网络层,通过闭式投影为深度高斯策略实施信任域。与现有方法不同,这些层为每个状态单独形式化信任域,并可补充现有的强化学习算法。我们基于 Kullback-Leibler 散度、Wasserstein L2 距离和高斯分布的 Frobenius 范数推导信任域投影。我们通过经验证明,这些投影层在几乎不受特定实现选择影响的情况下取得了与现有方法相似或更好的结果。代码可在 https://git.io/Jthb0 获取。

关键词

引用

@article{arxiv.2101.09207,
  title  = {Differentiable Trust Region Layers for Deep Reinforcement Learning},
  author = {Fabian Otto and Philipp Becker and Ngo Anh Vien and Hanna Carolin Ziesche and Gerhard Neumann},
  journal= {arXiv preprint arXiv:2101.09207},
  year   = {2021}
}

备注

Accepted at ICLR 2021, camera ready version