中文

基于经济强化学习的高效无人机轨迹规划

人工智能 2021-03-05 v1

摘要

无人机(UAV)设计的进步已开辟了从监视、消防、蜂窝网络到递送应用等多样应用。此外,由于成本下降,采用无人机集群的系统已变得流行。无人机在系统中的独特性创造了一类新颖的轨迹或路径规划与协调问题。环境包含远多于无人机数量的兴趣点(POIs),并存在障碍与禁飞区。我们提出 REPlanner,一种受经济交易启发、用于在无人机间分配任务的新型多智能体强化学习算法。该系统围绕一种经济理论,特别是无人机交易已分配 POIs 的拍卖机制展开。我们将路径规划问题表述为一种多智能体经济博弈,其中智能体可合作并竞争资源。随后我们将该问题转化为部分可观测马尔可夫决策过程(POMDP),其通过使用部署于每个智能体上的强化学习(RL)模型求解。由于系统通过无人机协作计算任务分配,其对集群规模的任何变化都具有高度韧性。我们提出的网络与经济博弈架构可作为一种涌现现象有效协调集群,同时保持集群的运作。评估结果证明 REPlanner 高效优于传统的基于 RL 的轨迹搜索。

关键词

引用

@article{arxiv.2103.02676,
  title  = {Efficient UAV Trajectory-Planning using Economic Reinforcement Learning},
  author = {Alvi Ataur Khalil and Alexander J Byrne and Mohammad Ashiqur Rahman and Mohammad Hossein Manshaei},
  journal= {arXiv preprint arXiv:2103.02676},
  year   = {2021}
}