中文

MAD:一种用于受稳定性约束强化学习的幅度与方向策略参数化

系统与控制 2025-10-07 v2 机器学习 系统与控制

摘要

我们提出了幅度与方向(MAD)策略,这是一种用于强化学习(RL)的策略参数化方法,能够保持非线性动力学系统的 Lp 闭环稳定性。尽管基于非线性 Youala 变换和系统级综合的方法在描述所有稳定控制器方面具有完整性,但这些方法在参数化 Lp 稳定算子方面受到显著挑战。相比之下,MAD 策略通过对状态依赖特征进行显式反馈——这是强化学习管道成功关键因素——而不危及闭环稳定性。通过让控制输入的幅度由扰动反馈 Lp 稳定算子描述,而根据状态依赖特征通过通用函数逼近器选择其方向来实现。我们进一步刻画了在模型不匹配情况下的 MAD 策略的鲁棒稳定性。与现有扰动反馈策略参数化不同,MAD 策略引入了与模型无关 RL 管道兼容的状态反馈分量,确保仅凭开环稳定性假设即可实现闭环稳定。数值实验表明,MAD 策略使用深度确定性策略梯度(DDPG)方法训练后在未见情景下具有良好推广性能——在设计上保证闭环稳定性的同时,匹配标准神经网络策略的性能。

关键词

引用

@article{arxiv.2504.02565,
  title  = {MAD: A Magnitude And Direction Policy Parametrization for Stability Constrained Reinforcement Learning},
  author = {Luca Furieri and Sucheth Shenoy and Danilo Saccani and Andrea Martin and Giancarlo Ferrari-Trecate},
  journal= {arXiv preprint arXiv:2504.02565},
  year   = {2025}
}