MSACL:基于Lyapunov证书的多步骤演员-评论家学习用于指数稳定控制
机器学习
2026-03-24 v3 人工智能
机器人学
系统与控制
系统与控制
摘要
对于稳定控制任务,基于模型的强化学习(RL)方法面临诸多挑战,尤其是在高维环境中数据有限的情况下关于有效性和效率的问题。为此,我们提出一种多步骤演员-评论家学习方法,集成Lyapunov证书用于指数稳定控制(MSACL),这是一种新颖的方法,将指数稳定性引入离线最大熵强化学习(MERL)。与依赖复杂奖励工程和单步约束的现有RL方法不同,MSACL采用直观的奖励设计,利用多步骤样本实现探索性演员-评论家学习。具体而言,我们首先引入指数稳定标签(ESL),以分类训练样本,并提出 -加权聚合机制以学习Lyapunov证书。基于这些证书,我们进一步设计了稳定感知优势函数以引导策略优化,从而促进快速Lyapunov下降和稳健的状态收敛。我们在六个基准测试中评估了MSACL,包括四个稳定任务和两个高维跟踪任务。实验结果表明,其在标准RL基线和最先进的Lyapunov-based RL算法方面均表现出一致的性能提升。除了快速收敛外,MSACL对环境不确定性具有鲁棒性,并能对未见到的参考信号实现泛化。源代码和基准测试环境已 disponible at https://github.com/YuanZhe-Xing/MSACL。
关键词
引用
@article{arxiv.2512.24955,
title = {MSACL: Multi-Step Actor-Critic Learning with Lyapunov Certificates for Exponentially Stabilizing Control},
author = {Yongwei Zhang and Yuanzhe Xing and Quanyi Liang and Quan Quan and Zhikun She},
journal= {arXiv preprint arXiv:2512.24955},
year = {2026}
}
备注
This work has been submitted to the IEEE for possible publication