拟牛顿信赖域策略优化
机器学习
2019-12-30 v1 人工智能
机器人学
机器学习
摘要
我们提出一种用于策略优化的信赖域方法,该方法采用拟牛顿近似来计算Hessian矩阵,称为拟牛顿信赖域策略优化QNTRPO。梯度下降是处理连续控制强化学习任务的事实标准算法。该算法在广泛任务的强化学习中达到了最先进的性能。然而,该算法存在若干缺陷,包括:缺乏步长选择准则,以及收敛缓慢。我们研究了一种使用dogleg步长和对Hessian矩阵的拟牛顿近似的信赖域方法用于策略优化。我们通过广泛具有挑战性的连续控制任务的数值实验证明,我们所做的具体选择在样本数量方面是高效的,并提升了性能。
引用
@article{arxiv.1912.11912,
title = {Quasi-Newton Trust Region Policy Optimization},
author = {Devesh Jha and Arvind Raghunathan and Diego Romeres},
journal= {arXiv preprint arXiv:1912.11912},
year = {2019}
}
备注
3rd Conference on Robot Learning (CoRL 2019)