中文

监督学习用于随机最优控制

系统与控制 2024-09-10 v1 系统与控制

摘要

监督式机器学习具有强大的能力。近年来,它在计算机视觉和自然语言处理领域取得了巨大的突破。然而,将这些进展应用于最优控制仍然面临困难。数据是关键的限制因素。在没有获取最优策略、价值函数或演示行为的情况下,如何拟合策略呢?本文展示了如何为一类连续时间非线性随机最优控制问题自动生成监督学习数据。具体而言,通过对Hamilton-Jacobi-Bellman PDE进行线性重参数化并应用Feynman-Kac定理,我们可以通过模拟随机过程来抽样价值函数。硬件加速器如GPU能够快速生成大量训练数据。掌握了这些数据后,随机最优控制问题便转化为监督学习问题。

关键词

引用

@article{arxiv.2409.05792,
  title  = {Supervised Learning for Stochastic Optimal Control},
  author = {Vince Kurtz and Joel W. Burdick},
  journal= {arXiv preprint arXiv:2409.05792},
  year   = {2024}
}

备注

CDC 2024