中文

MM-LMPC:基于 bandit 模式选择的多模态学习模型预测控制

系统与控制 2025-10-02 v1 系统与控制

摘要

学习模型预测控制 (LMPC) 通过利用前几次执行的数据来提高迭代任务的性能。在每次迭代中,LMPC 从过去的轨迹中构建抽样安全集,并将其作为终端约束,终端代价由相应的到终点的代价给出。虽然有效,但 LMPC 严重依赖初始轨迹:代价较大的状态在后续迭代中很少被选为终端候选者,导致状态空间的部分区域未被探索,可能错失更好的解决方案。例如,在一条包含两条可能路径的到达-避障任务中,LMPC 可能持续细化最初较短的路径,而忽略可能导向全局更好解的备选路径。为克服这一局限,我们提出多模态 LMPC (MM-LMPC),将过去的轨迹聚类为模式,保持模式特定的终端集和价值函数。一种基于 bandit 的元控制器采用下置信界 (LCB) 策略在模式之间实现探索与开发的平衡,使所有模式都能得到系统性的细化。这使 MM-LMPC 能够跳出高成本局部最优解,发现全局更优解。我们建立了递归可行性、闭环稳定性、收敛于最佳模式的渐近收敛性,以及对数 regret 界。障碍规避任务的仿真实验验证了所提出方法的性能提升。

关键词

引用

@article{arxiv.2510.00410,
  title  = {MM-LMPC: Multi-Modal Learning Model Predictive Control via Bandit-Based Mode Selection},
  author = {Wataru Hashimoto and Kazumune Hashimoto},
  journal= {arXiv preprint arXiv:2510.00410},
  year   = {2025}
}

备注

This paper is submitted to 2026 American Control Conference (ACC)