中文

统一模型预测路径积分控制、强化学习与扩散模型用于最优控制与规划

机器学习 2025-03-05 v2

摘要

模型预测路径积分(MPPI)控制、强化学习(RL)和扩散模型各自在轨迹优化、决策制定和运动规划方面展现了强大性能。然而,这些方法传统上被视为具有独立优化框架的独立方法论。在本工作中,我们建立了一个统一的视角,通过基于吉布斯测度的梯度优化将MPPI、RL和扩散模型联系起来。我们首先证明MPPI可以被解释为在平滑能量函数上执行梯度上升。然后我们证明策略梯度方法通过对目标函数应用指数变换可以归约为MPPI。此外,我们建立了扩散模型中的反向采样过程遵循与MPPI相同的更新规则。

关键词

引用

@article{arxiv.2502.20476,
  title  = {Unifying Model Predictive Path Integral Control, Reinforcement Learning, and Diffusion Models for Optimal Control and Planning},
  author = {Yankai Li and Mo Chen},
  journal= {arXiv preprint arXiv:2502.20476},
  year   = {2025}
}

备注

updated RL subsection in Main section