中文

利用深度强化学习驯服自主水面艇实现路径跟踪与避障

机器学习 2019-12-20 v1 人工智能 机器人学

摘要

在本文中,我们探讨了将最先进的连续控制深度强化学习算法——近端策略优化(proximal policy optimization)——应用于双目标问题的可行性,即控制一个欠驱动自主水面艇沿先验已知路径航行,同时避开沿途静止障碍物。该人工智能体配备多个测距传感器用于障碍物检测,并在基于 OpenAI gym python 工具包构建的、具有随机生成特性的挑战性仿真环境中进行训练与评估。值得注意的是,该智能体被赋予对其自身奖励函数的实时洞察能力,使其能动态调整导引策略。根据其策略(从激进循迹到激进避障不等),训练后的智能体达到了 84% 至 100% 的回合成功率。

关键词

引用

@article{arxiv.1912.08578,
  title  = {Taming an autonomous surface vehicle for path following and collision avoidance using deep reinforcement learning},
  author = {Eivind Meyer and Haakon Robinson and Adil Rasheed and Omer San},
  journal= {arXiv preprint arXiv:1912.08578},
  year   = {2019}
}

备注

16 pages