中文

概率安全且高效的基于模型的强化学习

系统与控制 2025-07-30 v2 系统与控制

摘要

本文提出了解决安全关键型随机强化学习 (RL) 任务的方法,采用基于样本的模型基方法。该方法的核心在于一个作为函数逼近的模型预测控制 (MPC) 方案,提供基于模型的预测控制策略。为确保安全性,集成了概率控制屏障函数 (CBF) 到 MPC 控制器中。为逼近最优控制公式中随机性的影响并满足概率 CBF 条件,采用具有保证的样本基方法。此外,为抵消由于抽样而带来的额外计算负担,包含可学习的终端代价表述以纳入 MPC 目标中。部署了一个 RL 算法来学习终端代价和 CBF 约束。来自受限线性时不变系统问题的数值实验结果表明,所提方法在减少计算时间的同时,保持控制性能和安全性。

关键词

引用

@article{arxiv.2504.00626,
  title  = {Probabilistically safe and efficient model-based reinforcement learning},
  author = {Filippo Airaldi and Bart De Schutter and Azita Dabiri},
  journal= {arXiv preprint arXiv:2504.00626},
  year   = {2025}
}

备注

8 pages, 4 figures, accepted to 2025 CDC