神经协态投影调节器:一种带输入约束的实时最优控制无模型范式
系统与控制
2025-08-04 v1 系统与控制
摘要
基于学习的方法,特别是强化学习(RL),在无需显式系统模型的情况下解决最优控制任务方面显示出前景。然而,这些方法通常样本效率低,对奖励设计和超参数敏感,并且容易泛化能力差,尤其是在输入约束下。为了解决这些挑战,我们引入了神经协态投影调节器(NCPR),这是一种基于 Pontryagin 最小值原理(PMP)的无模型学习型最优控制框架,能够解决具有输入约束的非线性控制仿射系统中的二次型调节器问题。在该框架中,神经网络(NN)在自监督设置下进行训练,以系统的当前状态为输入,并预测有限时域的投影协态轨迹(即,由系统输入增益加权的协态)。随后,仅提取 NN 预测的第一个元素来求解一个轻量级二次规划(QP)。该工作流在反馈控制设置中执行,允许实时计算满足输入约束和一阶最优性条件的控制动作。我们在(1)一个独轮车模型机器人参考跟踪问题和(2)一个摆锤摆动任务上测试了所提出的基于学习的无模型二次型调节器。为了进行比较,在两个任务上都使用了强化学习;并且作为背景,在独轮车模型示例中使用了基于模型的控制器。我们的方法在未见过的系统状态和变化的输入约束方面都表现出优越的泛化能力,并且还显示出改进的采样效率。
引用
@article{arxiv.2508.00283,
title = {Neural Co-state Projection Regulator: A Model-free Paradigm for Real-time Optimal Control with Input Constraints},
author = {Lihan Lian and Uduak Inyang-Udoh},
journal= {arXiv preprint arXiv:2508.00283},
year = {2025}
}