中文

自适应平滑路径积分控制

系统与控制 2020-05-14 v1 机器学习 系统与控制

摘要

在路径积分控制问题中,最优受控动力系统的表示可被形式化计算并作为学习参数化策略的指引。路径积分交叉熵(PICE)方法试图利用这一点,但受限于较差的样本效率。我们提出一种称为ASPIC(自适应平滑路径积分控制)的无模型算法,其对代价函数施加inf-卷积以加速策略优化的收敛。我们将PICE识别为该技术的无限平滑极限,并表明PICE所遭受的样本效率问题在有限平滑水平下消失。对于零平滑,该方法成为代价的贪婪优化,这是当前强化学习中的标准做法。我们从解析与经验上表明中等平滑水平是最优的,这使得新方法优于PICE与直接代价优化两者。

关键词

引用

@article{arxiv.2005.06364,
  title  = {Adaptive Smoothing Path Integral Control},
  author = {Dominik Thalmeier and Hilbert J. Kappen and Simone Totaro and Vicenç Gómez},
  journal= {arXiv preprint arXiv:2005.06364},
  year   = {2020}
}

备注

23 pages, 5 figures, NeurIPS 2019 Optimization Foundations of Reinforcement Learning Workshop (OptRL 2019)