信赖域策略优化
机器学习
2017-04-24 v5
摘要
我们描述了一种用于优化策略的迭代过程,具有保证的单调改进。通过对理论依据充分的过程进行若干近似,我们开发了名为信赖域策略优化 (TRPO) 的实用算法。该算法类似于自然策略梯度方法,并可有效优化诸如神经网络的大型非线性策略。我们的实验展示了其在多种任务上的鲁棒性能:学习模拟机器人游泳、跳跃与行走步态;以及以屏幕图像作为输入来玩 Atari 游戏。尽管其近似偏离了理论,TRPO 往往能给出单调改进,且只需很少的超参数调节。
引用
@article{arxiv.1502.05477,
title = {Trust Region Policy Optimization},
author = {John Schulman and Sergey Levine and Philipp Moritz and Michael I. Jordan and Pieter Abbeel},
journal= {arXiv preprint arXiv:1502.05477},
year = {2017}
}
备注
16 pages, ICML 2015