中文

基于 RL 信息的 Q 指导下 Stein 变分模型预测控制

机器人学 2026-03-05 v3 人工智能 机器学习

摘要

模型预测控制(MPC)能在动力学约束下实现可靠的轨迹优化,但往往依赖准确的动力学模型和精心设计的代价函数。近期的基于学习的 MPC 方法旨在通过学习动力学、先验分布或价值相关指导信号来减少这些建模和成本设计的负担。然而,许多现有方法仍依赖确定性梯度求解器(如可微分 MPC)或参数化采样-based 更新(如 CEM/MPPI),这可能导致模式坍缩并收敛到单一主导解。我们提出了 Q-SVMPC,即 Q 指导下基于 Stein 变分的模型预测控制方法,融合了 RL 信息的策略先验,将基于学习的 MPC 表述为轨迹级别的后验推断,并通过 SVGD 在所学习的软 Q 值指导下细化轨迹粒子,以显式保留多样化解。实验在导航、机器人操控和真实水果采摘任务中表现出 improved 样本效率、稳定性和鲁棒性,优于 MPC、模型无 RL 和基于学习的 MPC 基线。

关键词

引用

@article{arxiv.2507.06625,
  title  = {Q-Guided Stein Variational Model Predictive Control via RL-informed Policy Prior},
  author = {Shizhe Cai and Zeya Yin and Jayadeep Jacob and Fabio Ramos},
  journal= {arXiv preprint arXiv:2507.06625},
  year   = {2026}
}

备注

8 pages, 6 figures