中文

基于强化学习规划器与模型预测控制执行器的安全性保证操纵

机器人学 2023-04-27 v2

摘要

深度强化学习(RL)被寄予厚望,以自主和自导向的方式应对具有挑战性的操纵任务。尽管强化学习的发展取得了重大进展,该范式的实际部署仍受至少两重障碍的阻碍,即奖励函数的工程化以及确保基于学习的控制器的安全性保证。在本文中,我们通过提出一个框架来解决这些具有挑战性的局限,该框架将使用稀疏奖励训练的强化学习规划器(planner)与模型预测控制器(MPC)执行器(actor)相融合,从而提供安全策略。一方面,RL规划器通过选择短期内易达成且有望长期导向目标目标的的中间目标,从稀疏奖励中学习。另一方面,MPC执行器将RL规划器建议的中间目标作为输入,并预测机器人的动作将如何使其在短期内到达该目标,同时避开任何障碍物。我们在四个具有动态障碍物的挑战性操纵任务上评估了我们的方法,结果表明,通过利用这两个组件的互补优势,智能体能够以100%成功率在复杂动态环境中安全解决操纵任务。视频见\url{https://videoviewsite.wixsite.com/mpc-hgg}。

关键词

引用

@article{arxiv.2304.09119,
  title  = {Safety Guaranteed Manipulation Based on Reinforcement Learning Planner and Model Predictive Control Actor},
  author = {Zhenshan Bing and Aleksandr Mavrichev and Sicong Shen and Xiangtong Yao and Kejia Chen and Kai Huang and Alois Knoll},
  journal= {arXiv preprint arXiv:2304.09119},
  year   = {2023}
}