用于端到端规划与控制的可微 MPC
机器学习
2019-10-15 v3 人工智能
最优化与控制
机器学习
摘要
我们提出将模型预测控制(MPC)用作连续状态与动作空间中强化学习的可微策略类的基础。这提供了一种利用并结合无模型与基于模型方法优势的途径。具体而言,我们通过使用控制器不动点处凸近似的 KKT 条件对 MPC 进行微分。利用该策略,我们能够通过端到端学习来学习控制器的代价函数与动力学。我们的实验聚焦于钟摆与 cartpole 域中的模仿学习,其中我们学习了 MPC 策略类的代价与动力学项。我们表明,我们的 MPC 策略比通用神经网络显著更具数据效率,且我们的方法在专家不可实现的设定下优于传统系统辨识。
引用
@article{arxiv.1810.13400,
title = {Differentiable MPC for End-to-end Planning and Control},
author = {Brandon Amos and Ivan Dario Jimenez Rodriguez and Jacob Sacks and Byron Boots and J. Zico Kolter},
journal= {arXiv preprint arXiv:1810.13400},
year = {2019}
}
备注
NeurIPS 2018