面向真实世界应用结合同策略与异策略方法
机器学习
2019-04-25 v1 机器学习
摘要
在本文中,我们指出强化学习中目标函数的一个基本性质,借此可将策略梯度目标重构为感知机式损失函数,从而无需区分同策略与异策略训练。即我们假定,仅对满足条件 的情形更新策略 已足够,其中 为优势函数, 为另一策略。此外,我们通过理论推导表明,感知机式损失函数与PPO的截断替代目标相匹配。依据我们的新公式,策略 与 在理论上可任意远离,从而有效实现异策略训练。为检验推导,我们将同策略PPO截断替代目标(我们证明其等价于新重构的一个实例)与异策略IMPALA方法结合。我们首先在OpenAI Gym倒立摆玩具问题上验证组合方法。接着,我们用该方法在模拟器中训练四旋翼位置控制器。我们所训练的策略高效且轻量,足以在低成本微控制器中以最低500 Hz更新率运行。对于四旋翼,我们展示了两个实验来验证方法并展示性能:1)定点悬停;2)沿特定轨迹跟踪。在初步试验中,我们亦能将该方法应用于真实世界四旋翼。
引用
@article{arxiv.1904.10642,
title = {Towards Combining On-Off-Policy Methods for Real-World Applications},
author = {Kai-Chun Hu and Chen-Huan Pi and Ting Han Wei and I-Chen Wu and Stone Cheng and Yi-Wei Dai and Wei-Yuan Ye},
journal= {arXiv preprint arXiv:1904.10642},
year = {2019}
}