中文

用于VTOL-UAV海上对接操作的仿真到现实策略迁移的深度强化学习

机器人学 2024-08-01 v2

摘要

本文提出了一种新颖的强化学习(RL)方法,用于垂直起降无人机(VTOL-UAV)的仿真到现实策略迁移。所提出的方法旨在用于海上作业中VTOL-UAV在海上对接站上的着陆。海上作业中的VTOL-UAV在其操作范围方面存在限制,主要源于电池容量的限制。在充电平台上自主着陆的概念为缓解这些限制提供了一个有趣的前景,通过促进电池充电和数据传输。然而,当前的深度强化学习(DRL)方法存在缺点,包括训练时间长和成功率不高。在本文中,我们通过将着陆过程分解为一系列更易处理但类似的任务(即进场阶段和着陆阶段)来全面解决这些问题。所提出的架构在进场阶段采用基于模型的控制方案,其中VTOL-UAV正在接近海上对接站。在着陆阶段,DRL智能体被离线训练以学习在海上站对接的最优策略。采用联合北海波浪项目(JONSWAP)谱模型为每个情节创建波浪模型,增强了策略的泛化能力以进行sim2real迁移。通过数值模拟测试了一组DRL算法,包括基于价值的智能体和基于策略的智能体,例如深度Q网络(DQN)和近端策略优化(PPO)。数值实验表明,PPO智能体可以学习复杂且高效的策略以在不确定环境中着陆,这反过来增加了成功进行仿真到现实迁移的可能性。

关键词

引用

@article{arxiv.2406.00887,
  title  = {Deep Reinforcement Learning for Sim-to-Real Policy Transfer of VTOL-UAVs Offshore Docking Operations},
  author = {Ali M. Ali and Aryaman Gupta and Hashim A. Hashim},
  journal= {arXiv preprint arXiv:2406.00887},
  year   = {2024}
}