中文

利用连续时间梯度实现更快速的策略学习

机器学习 2021-06-25 v2 机器学习

摘要

我们研究具有已知动态的连续时间系统的策略梯度估计。通过将策略学习重构于连续时间中,我们表明可以构建更高效且准确的梯度估计器。标准的时间反向传播估计器(BPTT)对连续时间系统的粗略离散化计算精确梯度。相反,我们在原始系统中近似连续时间梯度。以估计连续时间梯度为明确目标,我们能够自适应离散化并构建一种更高效的策略梯度估计器,称之为连续时间策略梯度(CTPG)。我们表明,在多种控制任务与仿真器中,用更高效的 CTPG 估计替换 BPTT 策略梯度可带来更快速且更鲁棒的学习。

关键词

引用

@article{arxiv.2012.06684,
  title  = {Faster Policy Learning with Continuous-Time Gradients},
  author = {Samuel Ainsworth and Kendall Lowrey and John Thickstun and Zaid Harchaoui and Siddhartha Srinivasa},
  journal= {arXiv preprint arXiv:2012.06684},
  year   = {2021}
}