面向自主水下机器人路径跟踪的深度交互强化学习
人工智能
2020-01-13 v1 机器学习
机器人学
摘要
自主水下机器人(AUV)在海洋探索中扮演着日益重要的角色。现有AUV通常并非完全自主,一般局限于预规划或预编程任务。强化学习(RL)与深度强化学习已被引入AUV设计与研究中以提升其自主性。然而,由于奖励稀疏与学习效率低,这些方法仍难以直接应用于实际AUV系统。本文中,我们结合深度强化学习与交互式RL的优势,提出了一种用于AUV路径跟踪的深度交互强化学习方法。此外,由于人类训练员无法在AUV于海洋中运行时提供人类奖励,且AUV需适应变化的环境,我们进一步提出了一种同时从人类奖励与环境奖励学习的深度强化学习方法。我们在两项路径跟踪任务中测试了我们的方法——通过在Gazebo平台中仿真实现AUV的直线与正弦曲线跟踪。实验结果表明,采用我们所提深度交互RL方法,AUV比仅从环境奖励学习的DQN学习者收敛更快。此外,采用我们从人类与环境奖励同时学习的深度RL方法的AUV,也能取得与深度交互RL方法相似甚至更优的性能,并可通过进一步从环境奖励学习来适应实际环境。
引用
@article{arxiv.2001.03359,
title = {Deep Interactive Reinforcement Learning for Path Following of Autonomous Underwater Vehicle},
author = {Qilei Zhang and Jinying Lin and Qixin Sha and Bo He and Guangliang Li},
journal= {arXiv preprint arXiv:2001.03359},
year = {2020}
}