中文

基于深度强化学习的无人机导航与控制:一种结合后见之明经验回放的软 actor-critic 方法

系统与控制 2021-06-08 v2 机器学习 机器人学 系统与控制

摘要

在本文中,我们提出 SACHER(结合后见之明经验回放(HER)的软 actor-critic(SAC)),其构成一类深度强化学习(DRL)算法。SAC 作为一种基于最大熵框架的离策略无模型 DRL 算法而为人所知,在探索性、鲁棒性和学习性能方面优于早期的 DRL 算法。然而,在 SAC 中,最大化熵增广目标可能会降低学习结果的最优性。HER 作为一种样本高效的回放方法而为人所知,它通过使智能体从失败与成功中学习来提升离策略 DRL 算法的性能。我们将 HER 应用于 SAC 并提出 SACHER 以改善 SAC 的学习性能。更确切地说,由于 HER 提升了 SAC 的样本效率,SACHER 比 SAC 更快且更精确地达到期望的最优结果。我们将 SACHER 应用于无人机(UAV)的导航与控制问题,其中 SACHER 在各种作业障碍下生成无人机的最优导航路径。具体而言,我们通过将其与最先进的 DRL 算法 SAC 和 DDPG 在跟踪误差和累积奖励方面进行比较,展示了 SACHER 在无人机作业中的有效性。需注意,SACHER 在无人机导航与控制问题中可应用于任意型号的无人机。

关键词

引用

@article{arxiv.2106.01016,
  title  = {Deep Reinforcement Learning-based UAV Navigation and Control: A Soft Actor-Critic with Hindsight Experience Replay Approach},
  author = {Myoung Hoon Lee and Jun Moon},
  journal= {arXiv preprint arXiv:2106.01016},
  year   = {2021}
}

备注

12 page, 9 figures