中文

深度值模型预测控制

机器学习 2019-10-09 v1 机器人学 机器学习

摘要

本文中,我们引入一种称为深度值模型预测控制(Deep Value Model Predictive Control, DMPC)的 actor-critic 算法,其将基于模型的轨迹优化与值函数估计相结合。DMPC的 actor 是一个模型预测控制(Model Predictive Control, MPC)优化器,其目标函数由 critic 估计的值函数定义。我们证明我们的MPC actor是一个重要性采样器,其最小化到最优采样策略的状态分布的交叉熵的上界。在Ballbot系统的实验中,我们表明我们的算法可处理稀疏与二值奖励信号,高效解决避障与目标到达任务。与先前工作相比,我们表明在轨迹优化器的运行代价中纳入值函数可加速收敛。我们也讨论了在实践中使算法鲁棒化的必要策略。

关键词

引用

@article{arxiv.1910.03358,
  title  = {Deep Value Model Predictive Control},
  author = {Farbod Farshidian and David Hoeller and Marco Hutter},
  journal= {arXiv preprint arXiv:1910.03358},
  year   = {2019}
}

备注

Accepted for publication in the Conference on Robotic Learning (CoRL) 2019, Osaka. 10 pages (+5 supplementary)