中文

关于无限时域摆锤摆起最优值函数的非光滑几何与神经逼近

最优化与控制 2024-08-05 v3

摘要

我们重新审视倒立摆问题,旨在理解并计算真实的最优值函数。我们首先观察到,由于问题的对称性,真实的最优值函数必须是非光滑的(即非全局C1C^1)。随后,我们给出了一个结果,可用于认证候选分段C1C^1值函数的最优性。进一步地,对于通过数值近似获得的候选值函数,我们基于其 Hamilton-Jacobi-Bellman (HJB) 方程残差提供了次优性界限。受 Holzhuter (2004) 启发,我们设计了一种算法,从局部最优 LQR 值函数提供的终端条件出发,逆向求解 Pontryagin 极小值原理 (PMP) 常微分方程。该数值过程导出了一个分段C1C^1值函数,其非光滑区域包含周期性螺旋线,且光滑区域的 HJB 残差约为10410^{-4},从而认证其为最优值函数(仅存在微小的数值误差)。该最优值函数验证了最优性的力量:(i) 它位于多项式下界之上;(ii) 其诱导的控制器能全局摆起并稳定摆锤;(iii) 其轨迹成本低于能量整形、模型预测控制 (MPC) 和近端策略优化等基线方法(其中 MPC 的成本几乎相同)。最后,我们将该最优值函数蒸馏为一个简单的神经网络。我们的代码可在 https://github.com/ComputationalRobotics/InvertedPendulumOptimalValue 获取。

关键词

引用

@article{arxiv.2312.17467,
  title  = {On the Nonsmooth Geometry and Neural Approximation of the Optimal Value Function of Infinite-Horizon Pendulum Swing-up},
  author = {Haoyu Han and Heng Yang},
  journal= {arXiv preprint arXiv:2312.17467},
  year   = {2024}
}

备注

Published on 6th Learning for Dynamics and Control (L4DC)