基于 Kronecker 分解自然梯度的近端策略优化的实证分析
人工智能
2018-01-18 v1 机器学习
机器学习
摘要
在本技术报告中,我们考虑一种结合 PPO 目标与 K-FAC 自然梯度优化的方法,称之为 PPOKFAC。我们针对该算法的多个方面进行了一系列实证分析,例如样本复杂度、训练速度,以及对批大小与训练轮数的敏感性。我们观察到,在一系列 MuJoCo 环境中,PPOKFAC 在样本复杂度与速度上均优于 PPO,且在批大小方面具有可扩展性。尽管如此,增加更多轮数似乎未必有助于样本效率,且 PPOKFAC 似乎劣于其 A2C 对应方法 ACKTR。
引用
@article{arxiv.1801.05566,
title = {An Empirical Analysis of Proximal Policy Optimization with Kronecker-factored Natural Gradients},
author = {Jiaming Song and Yuhuai Wu},
journal= {arXiv preprint arXiv:1801.05566},
year = {2018}
}