中文

拟牛顿信赖域策略优化

机器学习 2019-12-30 v1 人工智能 机器人学 机器学习

摘要

我们提出一种用于策略优化的信赖域方法,该方法采用拟牛顿近似来计算Hessian矩阵,称为拟牛顿信赖域策略优化QNTRPO。梯度下降是处理连续控制强化学习任务的事实标准算法。该算法在广泛任务的强化学习中达到了最先进的性能。然而,该算法存在若干缺陷,包括:缺乏步长选择准则,以及收敛缓慢。我们研究了一种使用dogleg步长和对Hessian矩阵的拟牛顿近似的信赖域方法用于策略优化。我们通过广泛具有挑战性的连续控制任务的数值实验证明,我们所做的具体选择在样本数量方面是高效的,并提升了性能。

关键词

引用

@article{arxiv.1912.11912,
  title  = {Quasi-Newton Trust Region Policy Optimization},
  author = {Devesh Jha and Arvind Raghunathan and Diego Romeres},
  journal= {arXiv preprint arXiv:1912.11912},
  year   = {2019}
}

备注

3rd Conference on Robot Learning (CoRL 2019)