基于学习的哈密顿-雅可比-贝尔曼方法用于最优控制
最优化与控制
2019-07-25 v1
摘要
许多最优控制问题被表述为两点边值问题(TPBVP),其最优性条件由哈密顿-雅可比-贝尔曼(HJB)方程导出。在大多数情况下,由于难以猜测伴随变量,求解HJB方程具有挑战性。本文提出了两种基于学习的方法来实时找到伴随变量的初始猜测,这些方法可用于求解一般的TPBVP。对于具有不同边界条件下TPBVP的解和相应伴随变量数据库的情况,应用监督学习方法离线学习HJB解。在从监督学习获得训练好的神经网络后,我们能够实时为给定的边界条件找到合适的初始伴随变量。然而,当TPBVP的验证解不可用时,应用强化学习方法通过构建神经网络、定义奖励函数和设置适当的超参数来求解HJB。基于强化学习的HJB方法可以通过更新神经网络学习如何找到准确的伴随变量。最后,两种学习方法都在经典最优控制问题中实现,以验证基于学习的HJB方法的有效性。
引用
@article{arxiv.1907.10097,
title = {Learning-based Hamilton-Jacobi-Bellman Methods for Optimal Control},
author = {Sixiong You and Ran Dai and Ping Lu},
journal= {arXiv preprint arXiv:1907.10097},
year = {2019}
}