基于目标分布学习的连续控制策略搜索
机器学习
2019-11-19 v2 机器学习
摘要
我们观察到若干现有策略梯度方法(如 vanilla 策略梯度、PPO、A2C)在当前策略接近确定性时(即便在一些非常简单的环境中)可能遭受过大的梯度,导致训练过程不稳定。为解决此问题,我们提出一种称为目标分布学习(target distribution learning, TDL)的新方法,用于强化学习中的策略改进。TDL 交替进行提出目标分布与训练策略网络逼近目标分布。TDL 在约束更新策略间 KL 散度上更为有效,从而带来迭代中更稳定的策略改进。我们的实验表明,在 MuJoCo 环境下的大多数连续控制任务中,TDL 算法表现与最先进算法相当(或更好),同时在训练上更为稳定。
引用
@article{arxiv.1905.11041,
title = {Policy Search by Target Distribution Learning for Continuous Control},
author = {Chuheng Zhang and Yuanqi Li and Jian Li},
journal= {arXiv preprint arXiv:1905.11041},
year = {2019}
}
备注
AAAI-20 (oral)