中文

基于无雅可比反向传播的高维最优控制隐式哈特顿函数端到端训练

最优化与控制 2025-10-08 v2 机器学习

摘要

参数化价值函数的神经网络方法在哈特顿函数具有显式公式时成功近似高维最优反馈控制器。然而,许多实际问题,如空间 shuttle 再入问题和自行车动力学等,可能涉及不具备显式公式的隐式哈特顿函数,限制了现有方法的适用性。与直接参数化控制器不同,我们提出一种端到端的隐式深度学习方法,直接参数化价值函数以学习最优控制律。我们的 метод通过确保训练得到的网络遵循控制律的物理原理来实现,这是由庞特莱茨最大原理与动态规划之间关系的直接结果;即,最优控制与价值函数的梯度之间存在基本关系。利用无雅可比反向传播 (Jacobian-Free Backpropagation, JFB),我们即使在轨迹优化中存在时间耦合,仍能实现高效训练。我们表明 JFB 为最优控制目标产生下降方向,并通过实验表明,我们的方法在涉及隐式哈特顿函数的多个情境下有效学习高维反馈控制器,而现有方法无法实现。

关键词

引用

@article{arxiv.2510.00359,
  title  = {End-to-End Training of High-Dimensional Optimal Control with Implicit Hamiltonians via Jacobian-Free Backpropagation},
  author = {Eric Gelphman and Deepanshu Verma and Nicole Tianjiao Yang and Stanley Osher and Samy Wu Fung},
  journal= {arXiv preprint arXiv:2510.00359},
  year   = {2025}
}