Lyapunov 神经 ODE 状态反馈控制策略
机器学习
2025-11-04 v3 系统与控制
系统与控制
摘要
深度神经网络日益成为各种学习型控制范式中有效控制策略参数化的工具。对于连续时间最优控制问题(OCP),这些问题是许多决策任务的核心,控制策略学习可被建模为神经常微分方程(NODE),其中自然地能容纳状态和控制约束。本文提出了一种解决连续时间 OCP 的 NODE 方法,针对已知受约束的非线性系统在目标状态附近的稳定问题。该方法称为 Lyapunov-NODE 控制(L-NODEC),采用一种新颖的 Lyapunov 损失函数,融合指数稳定控制 Lyapunov 函数,以学习状态反馈神经控制策略,弥合了通过 NODE 求解连续时间 OCP 的稳定性保障之间的差距。提出的 Lyapunov 损失使 L-NODEC 能够保证受控系统的指数稳定性,以及对初始状态扰动的对抗鲁棒性。L-NODEC 的性能在两个问题中得到验证,包括等离子医学中的剂量输送问题。在两种情况下,L-NODEC 均能有效地在初始状态受扰动的情况下将受控系统稳定在目标状态附近,并显著降低达到目标所需的推理时间。
引用
@article{arxiv.2409.00393,
title = {Lyapunov Neural ODE State-Feedback Control Policies},
author = {Joshua Hang Sai Ip and Georgios Makrygiorgos and Ali Mesbah},
journal= {arXiv preprint arXiv:2409.00393},
year = {2025}
}