中文

基于深度强化学习方法的二维环境自主船舶研究

机器学习 2020-03-24 v1 人工智能

摘要

无人水面艇(USVs)技术是一个令人振奋的课题,其本质上是部署一种算法以安全高效地执行任务。尽管强化学习是对此类任务建模的知名方法,但在将离策略(off-policy)与函数逼近相结合时可能出现不稳定与发散现象。在本工作中,我们采用深度强化学习,将 Q-learning 与神经表示相结合以避免不稳定性。我们的方法使用深度 Q-learning,并将其与敏捷方法中的滚动波规划(rolling wave planning)方式相结合。我们的方法包含两个部分以在未知环境中执行任务。其一是路径规划器,负责生成通往目的地的潜在有效路径而不考虑路径细节;其二是决策模块,负责在 USV 近期运行的价值函数背景下就避障作出短期决策。仿真使用两种算法进行:作为基线的基础原始船舶导航器(VVN)以及改进的带规划器与局部视野的船舶导航器(VNPLV)。实验结果表明,所提方法在长距离任务中平均将 VVN 性能提升了 55.31。我们的模型通过深度强化学习利用规划自适应路径在未知环境中成功实现了避障。

关键词

引用

@article{arxiv.2003.10249,
  title  = {Using Deep Reinforcement Learning Methods for Autonomous Vessels in 2D Environments},
  author = {Mohammad Etemad and Nader Zare and Mahtab Sarvmaili and Amilcar Soares and Bruno Brandoli Machado and Stan Matwin},
  journal= {arXiv preprint arXiv:2003.10249},
  year   = {2020}
}