基于样本复杂度的 Actor-critic 与直接策略搜索比较
机器学习
2016-08-23 v2
摘要
在优化机器人控制器的策略参数时,样本效率是一个关键属性。本文中,我们评估了两种最先进的策略优化算法。一种是基于 actor-critic 算法的深度强化学习方法,即深度确定性策略梯度 (DDPG),已被证明在各种控制基准上表现良好。另一种是直接策略搜索方法,协方差矩阵适应进化策略 (CMA-ES),一种广泛用于机器人学习的黑盒优化方法。这些算法在山地车基准问题的连续版本上进行评估,以比较它们的样本复杂度。根据初步分析,我们预期 DDPG 比 CMA-ES 更具样本效率,这被我们的实验结果所证实。
引用
@article{arxiv.1606.09152,
title = {Actor-critic versus direct policy search: a comparison based on sample complexity},
author = {Arnaud de Froissard de Broissia and Olivier Sigaud},
journal= {arXiv preprint arXiv:1606.09152},
year = {2016}
}
备注
Proceedings JFPDA (Journees Francaises Planification Decision Apprentissage)