中文

面向模型预测控制的实用强化学习:在真实机器人上不到一小时从稀疏目标中学习

机器人学 2020-04-21 v2 最优化与控制

摘要

模型预测控制(MPC)是一种强大的控制技术,它能够处理约束、考虑系统动力学并针对给定代价函数进行优化。然而在实践中,它通常需要专家来设计并调整该代价函数,并在不同状态惩罚之间权衡以满足简单的高层目标。在本文中,我们使用强化学习,特别是价值学习,在仅给定高层目标(可以是稀疏且二值的)的情况下近似价值函数。在先前工作的基础上,我们提出了一些改进,使我们能够成功地将该方法部署在真实世界的无人地面车辆上。我们的实验表明,我们的方法可以从零开始且在无需人工干预的情况下学习代价函数,同时达到与专家调参的MPC相近的性能水平。我们在仿真和真实机器人上对这些方法与标准MPC方法进行了定量比较。

关键词

引用

@article{arxiv.2003.03200,
  title  = {Practical Reinforcement Learning For MPC: Learning from sparse objectives in under an hour on a real robot},
  author = {Napat Karnchanachari and Miguel I. Valls and David Hoeller and Marco Hutter},
  journal= {arXiv preprint arXiv:2003.03200},
  year   = {2020}
}

备注

14 pages, 6 figures, submitted to L4DC 2020