中文

无限时域模型预测控制中规划的价值

机器人学 2021-04-08 v1 机器学习

摘要

模型预测控制(MPC)是用于复杂现实系统最优控制的经典工具。尽管已成功应用于机器人学中一系列具有挑战性的任务,它从根本上受预测时域的限制,若时域过短将导致短视决策。近来,若干论文建议采用学习得到的价值函数作为 MPC 的终端代价。若价值函数准确,它可有效使 MPC 能推理无限时域。遗憾的是,用于价值函数近似的强化学习(RL)方案在机器人任务中难以实现。在本文中,我们提出一种更高效的适用于目标导向问题(如到达与导航)的价值函数近似方法。在这些问题中,MPC 常被构建为跟踪规划器返回的路径或轨迹。然而该策略脆弱,因为对机器人的意外扰动将需要重新规划,这在运行时代价高昂。相反,我们展示了现代规划器使用的中间数据结构如何被解释为近似价值函数。我们表明该价值函数可被 MPC 直接使用,从而在运行时产生更高效且更具韧性的行为。

关键词

引用

@article{arxiv.2104.02863,
  title  = {The Value of Planning for Infinite-Horizon Model Predictive Control},
  author = {Nathan Hatch and Byron Boots},
  journal= {arXiv preprint arXiv:2104.02863},
  year   = {2021}
}

备注

7 pages, 8 figures. To appear in the proceedings of the International Conference on Robotics and Automation (ICRA) 2021