深度值模型预测控制
机器学习
2019-10-09 v1 机器人学
机器学习
摘要
本文中,我们引入一种称为深度值模型预测控制(Deep Value Model Predictive Control, DMPC)的 actor-critic 算法,其将基于模型的轨迹优化与值函数估计相结合。DMPC的 actor 是一个模型预测控制(Model Predictive Control, MPC)优化器,其目标函数由 critic 估计的值函数定义。我们证明我们的MPC actor是一个重要性采样器,其最小化到最优采样策略的状态分布的交叉熵的上界。在Ballbot系统的实验中,我们表明我们的算法可处理稀疏与二值奖励信号,高效解决避障与目标到达任务。与先前工作相比,我们表明在轨迹优化器的运行代价中纳入值函数可加速收敛。我们也讨论了在实践中使算法鲁棒化的必要策略。
引用
@article{arxiv.1910.03358,
title = {Deep Value Model Predictive Control},
author = {Farbod Farshidian and David Hoeller and Marco Hutter},
journal= {arXiv preprint arXiv:1910.03358},
year = {2019}
}
备注
Accepted for publication in the Conference on Robotic Learning (CoRL) 2019, Osaka. 10 pages (+5 supplementary)