中文

基于强化学习的多旋翼在移动平台上的自主着陆

机器人学 2024-05-17 v3 系统与控制 系统与控制

摘要

多旋翼无人机受限于有限的电池容量,航程与飞行时间受限。在二维移动平台上自主着陆提供了补充电池与卸载数据的可能,从而提升飞行器效用。经典方法依赖于精确、复杂且难以推导的飞行器与环境模型。强化学习(RL)提供了一种有吸引力的替代方案,因其能够仅在训练过程中从数据学习合适的控制策略。然而,现有方法需数小时训练,成功率有限,且依赖于需经试错调参的超参数。我们在本工作中解决所有这些问题。首先,我们将着陆过程分解为一系列更简单但相似的学习任务。这是通过应用两个相同的、针对一维运动训练的基于 RL 的控制器实例,分别控制多旋翼在纵向与横向的运动来实现。其次,我们引入一种强大的状态空间离散化技术,其基于 i) 移动平台的运动学建模以推导状态空间拓扑信息,以及 ii) 利用迁移学习将训练构建为顺序课程。第三,我们利用移动平台的运动学模型推导可解释的 training 超参数,以确保多旋翼飞行器的充分机动性。训练采用表格型 RL 方法 Double Q-Learning 执行。通过大量仿真我们表明,所提方法显著提高了成功着陆率,同时相比其他深度 RL 方法所需训练时间更少。最后,我们在真实硬件上部署并演示了我们的算法。对于所有评估场景,我们提供了智能体性能的统计信息。

关键词

引用

@article{arxiv.2302.13192,
  title  = {Reinforcement Learning based Autonomous Multi-Rotor Landing on Moving Platforms},
  author = {Pascal Goldschmid and Aamir Ahmad},
  journal= {arXiv preprint arXiv:2302.13192},
  year   = {2024}
}

备注

24 pages, 13 figures, 13 tables