概率安全且高效的基于模型的强化学习
系统与控制
2025-07-30 v2 系统与控制
摘要
本文提出了解决安全关键型随机强化学习 (RL) 任务的方法,采用基于样本的模型基方法。该方法的核心在于一个作为函数逼近的模型预测控制 (MPC) 方案,提供基于模型的预测控制策略。为确保安全性,集成了概率控制屏障函数 (CBF) 到 MPC 控制器中。为逼近最优控制公式中随机性的影响并满足概率 CBF 条件,采用具有保证的样本基方法。此外,为抵消由于抽样而带来的额外计算负担,包含可学习的终端代价表述以纳入 MPC 目标中。部署了一个 RL 算法来学习终端代价和 CBF 约束。来自受限线性时不变系统问题的数值实验结果表明,所提方法在减少计算时间的同时,保持控制性能和安全性。
引用
@article{arxiv.2504.00626,
title = {Probabilistically safe and efficient model-based reinforcement learning},
author = {Filippo Airaldi and Bart De Schutter and Azita Dabiri},
journal= {arXiv preprint arXiv:2504.00626},
year = {2025}
}
备注
8 pages, 4 figures, accepted to 2025 CDC