中文

基于 MPC 的自主水面船舶简化货运任务强化学习

系统与控制 2021-08-06 v2 系统与控制

摘要

在这项工作中,我们提出一种面向自主水面船舶(ASV)的基于模型预测控制(MPC)的强化学习(RL)方法。目标是找到一种最优策略,使简化货运任务的闭环性能最小化,包括无碰撞路径跟踪、自主靠泊以及两者之间的熟练过渡。我们使用参数化 MPC 方案来近似最优策略,该方案考虑了路径跟踪/靠泊代价以及状态(位置、速度)/输入(推力器力、角度)约束。然后应用基于最小二乘时序差分(LSTD)的确定性策略梯度(DPG)方法来更新策略参数。我们的仿真结果表明,所提出的基于 MPC-LSTD 的 DPG 方法能够改善 ASV 货运任务问题在学习过程中的闭环性能。

关键词

引用

@article{arxiv.2106.08634,
  title  = {MPC-based Reinforcement Learning for a Simplified Freight Mission of Autonomous Surface Vehicles},
  author = {Wenqi Cai and Arash B. Kordabad and Hossein N. Esfahani and Anastasios M. Lekkas and Sebastien Gros},
  journal= {arXiv preprint arXiv:2106.08634},
  year   = {2021}
}

备注

6 pages, 7 figures, this paper has been accepted to be presented at 2021 60th IEEE Conference on Decision and Control (CDC)