中文

面向真实世界应用结合同策略与异策略方法

机器学习 2019-04-25 v1 机器学习

摘要

在本文中,我们指出强化学习中目标函数的一个基本性质,借此可将策略梯度目标重构为感知机式损失函数,从而无需区分同策略与异策略训练。即我们假定,仅对满足条件 A(πμ1)0A(\frac{\pi}{\mu}-1)\leq0 的情形更新策略 π\pi 已足够,其中 AA 为优势函数,μ\mu 为另一策略。此外,我们通过理论推导表明,感知机式损失函数与PPO的截断替代目标相匹配。依据我们的新公式,策略 π\piμ\mu 在理论上可任意远离,从而有效实现异策略训练。为检验推导,我们将同策略PPO截断替代目标(我们证明其等价于新重构的一个实例)与异策略IMPALA方法结合。我们首先在OpenAI Gym倒立摆玩具问题上验证组合方法。接着,我们用该方法在模拟器中训练四旋翼位置控制器。我们所训练的策略高效且轻量,足以在低成本微控制器中以最低500 Hz更新率运行。对于四旋翼,我们展示了两个实验来验证方法并展示性能:1)定点悬停;2)沿特定轨迹跟踪。在初步试验中,我们亦能将该方法应用于真实世界四旋翼。

关键词

引用

@article{arxiv.1904.10642,
  title  = {Towards Combining On-Off-Policy Methods for Real-World Applications},
  author = {Kai-Chun Hu and Chen-Huan Pi and Ting Han Wei and I-Chen Wu and Stone Cheng and Yi-Wei Dai and Wei-Yuan Ye},
  journal= {arXiv preprint arXiv:1904.10642},
  year   = {2019}
}