Soft MPCritic: 摊销模型预测值迭代
机器学习
2026-04-03 v1 系统与控制
系统与控制
摘要
强化学习 (RL) 和模型预测控制 (MPC) 提供互补优势,但在大规模下结合它们仍具计算挑战性。我们提出 soft MPCritic,一个 RL-MPC 框架,在(软)值空间中学习,同时使用基于采样的规划进行在线控制和值目标生成。soft MPCritic 通过模型预测路径积分控制 (MPPI) 实例化 MPC,并通过拟合值迭代训练终端 Q 函数,使学到的值函数与规划器对齐并隐式扩展有效规划 horizon。我们引入一种摊销预热启动策略,在计算批量 MPPI 基值目标时回收来自在线观测的已规划开环动作序列。这使 soft MPCritic 在保持解质量的同时具有计算可行性。soft MPCritic 以基于场景的方式进行规划,使用用于下一步预测精度的动态模型集成。综合这些要素,soft MPCritic 能够通过鲁棒的短 horizon 规划在经典和复杂控制任务上有效学习。这些结果确立了 soft MPCritic 作为在策略提取和直接长 horizon 规划可能失败的设置中合成 MPC 策略的实用且可扩展的蓝图。
引用
@article{arxiv.2604.01477,
title = {Soft MPCritic: Amortized Model Predictive Value Iteration},
author = {Thomas Banker and Nathan P. Lawrence and Ali Mesbah},
journal= {arXiv preprint arXiv:2604.01477},
year = {2026}
}
备注
submitted to CDC 2026