关于无限时域摆锤摆起最优值函数的非光滑几何与神经逼近
最优化与控制
2024-08-05 v3
摘要
我们重新审视倒立摆问题,旨在理解并计算真实的最优值函数。我们首先观察到,由于问题的对称性,真实的最优值函数必须是非光滑的(即非全局)。随后,我们给出了一个结果,可用于认证候选分段值函数的最优性。进一步地,对于通过数值近似获得的候选值函数,我们基于其 Hamilton-Jacobi-Bellman (HJB) 方程残差提供了次优性界限。受 Holzhuter (2004) 启发,我们设计了一种算法,从局部最优 LQR 值函数提供的终端条件出发,逆向求解 Pontryagin 极小值原理 (PMP) 常微分方程。该数值过程导出了一个分段值函数,其非光滑区域包含周期性螺旋线,且光滑区域的 HJB 残差约为,从而认证其为最优值函数(仅存在微小的数值误差)。该最优值函数验证了最优性的力量:(i) 它位于多项式下界之上;(ii) 其诱导的控制器能全局摆起并稳定摆锤;(iii) 其轨迹成本低于能量整形、模型预测控制 (MPC) 和近端策略优化等基线方法(其中 MPC 的成本几乎相同)。最后,我们将该最优值函数蒸馏为一个简单的神经网络。我们的代码可在 https://github.com/ComputationalRobotics/InvertedPendulumOptimalValue 获取。
引用
@article{arxiv.2312.17467,
title = {On the Nonsmooth Geometry and Neural Approximation of the Optimal Value Function of Infinite-Horizon Pendulum Swing-up},
author = {Haoyu Han and Heng Yang},
journal= {arXiv preprint arXiv:2312.17467},
year = {2024}
}
备注
Published on 6th Learning for Dynamics and Control (L4DC)