利用深度强化学习驯服自主水面艇实现路径跟踪与避障
机器学习
2019-12-20 v1 人工智能
机器人学
摘要
在本文中,我们探讨了将最先进的连续控制深度强化学习算法——近端策略优化(proximal policy optimization)——应用于双目标问题的可行性,即控制一个欠驱动自主水面艇沿先验已知路径航行,同时避开沿途静止障碍物。该人工智能体配备多个测距传感器用于障碍物检测,并在基于 OpenAI gym python 工具包构建的、具有随机生成特性的挑战性仿真环境中进行训练与评估。值得注意的是,该智能体被赋予对其自身奖励函数的实时洞察能力,使其能动态调整导引策略。根据其策略(从激进循迹到激进避障不等),训练后的智能体达到了 84% 至 100% 的回合成功率。
引用
@article{arxiv.1912.08578,
title = {Taming an autonomous surface vehicle for path following and collision avoidance using deep reinforcement learning},
author = {Eivind Meyer and Haakon Robinson and Adil Rasheed and Omer San},
journal= {arXiv preprint arXiv:1912.08578},
year = {2019}
}
备注
16 pages