中文

深度强化学习用于自主水下航行器连续对接控制:一项基准研究

机器人学 2021-08-06 v1 机器学习

摘要

自主水下航行器(AUV)的对接控制是实现持久长期自主性的关键任务。本工作探索了最先进的免模型深度强化学习(DRL)方法在连续域中 AUV 对接任务上的应用。我们提供了奖励函数的详细公式,用于成功将 AUV 对接到固定对接平台。区别于先前方法的主要贡献在于使用物理模拟器来定义和模拟水下环境以及 DeepLeng AUV。我们提出了一种新的对接任务奖励函数公式,包含若干组件,优于先前的奖励公式。我们评估了近端策略优化(PPO)、双延迟深度确定性策略梯度(TD3)和软 actor-critic(SAC)结合我们的奖励函数。我们的评估得出的结果明确显示 TD3 智能体在 AUV 对接方面最高效且稳定,在多次评估运行中达到了 100% 成功率和 10667.1 ± 688.8 的回合回报。我们还展示了我们的奖励函数公式相对于最先进方法的改进。

关键词

引用

@article{arxiv.2108.02665,
  title  = {Deep Reinforcement Learning for Continuous Docking Control of Autonomous Underwater Vehicles: A Benchmarking Study},
  author = {Mihir Patil and Bilal Wehbe and Matias Valdenegro-Toro},
  journal= {arXiv preprint arXiv:2108.02665},
  year   = {2021}
}

备注

Global Oceans 2021 Camera ready, 7 pages, 11 figures