联合RL与MPC用于混合整数最优控制:应用于方程式1赛车策略
系统与控制
2026-04-02 v1 系统与控制
摘要
我们提出了一种混合强化学习(RL)和模型预测控制(MPC)框架,用于混合整数最优控制,其中离散变量进入目标函数和动力学,但不进入约束。现有层次方法仅在离散动作空间中使用RL,连续优化交由MPC完成。与这些方法不同,我们在完整的混合动作空间上训练RL智能体,确保其与底层马尔可夫决策过程成本一致。在部署时,RL演员在预测时域内滚动,以离散动作序列为参数化一个无整数的非线性MPC,同时提供连续初始解。所学的批评家作为终端成本以捕获长期性能。我们证明了递归可行性,在方程式1赛车策略问题上进行了验证。该混合方法相对于离线混合整数非线性规划基准实现近乎最优的性能,超越独立的RL智能体。此外,该混合方案通过模块化MPC扩展在零再训练成本下适应未见的扰动。
引用
@article{arxiv.2604.00826,
title = {Bridging RL and MPC for mixed-integer optimal control with application to Formula 1 race strategies},
author = {Joschua Wüthrich and Romir Damle and Giona Fieni and Melanie N. Zeilinger and Christopher H. Onder and Andrea Carron},
journal= {arXiv preprint arXiv:2604.00826},
year = {2026}
}
备注
8 pages, 5 figures; This work has been submitted to the IEEE for possible publication