中文

基于目标分布学习的连续控制策略搜索

机器学习 2019-11-19 v2 机器学习

摘要

我们观察到若干现有策略梯度方法(如 vanilla 策略梯度、PPO、A2C)在当前策略接近确定性时(即便在一些非常简单的环境中)可能遭受过大的梯度,导致训练过程不稳定。为解决此问题,我们提出一种称为目标分布学习(target distribution learning, TDL)的新方法,用于强化学习中的策略改进。TDL 交替进行提出目标分布与训练策略网络逼近目标分布。TDL 在约束更新策略间 KL 散度上更为有效,从而带来迭代中更稳定的策略改进。我们的实验表明,在 MuJoCo 环境下的大多数连续控制任务中,TDL 算法表现与最先进算法相当(或更好),同时在训练上更为稳定。

关键词

引用

@article{arxiv.1905.11041,
  title  = {Policy Search by Target Distribution Learning for Continuous Control},
  author = {Chuheng Zhang and Yuanqi Li and Jian Li},
  journal= {arXiv preprint arXiv:1905.11041},
  year   = {2019}
}

备注

AAAI-20 (oral)