中文

基于深度强化学习的动态无人机通信网络响应式调控

系统与控制 2021-08-26 v1 机器学习 系统与控制

摘要

本章研究了在无人机编队和用户分布存在动态变化的情况下,对无人机通信网络的调控问题。我们的目标是找到一种最优的无人机控制策略,该策略能够识别无人机编队(退出或加入)或用户分布即将发生的变化,并在变化发生前主动重新部署无人机,而不是在变化发生后被动调度。具体而言,我们开发了一个基于深度强化学习(DRL)的无人机控制框架,以在给定的时间范围内最大化累积用户满意度(US)得分,该框架能够处理无人机编队和用户分布两方面的变化。该框架通过精心设计的状态转移,适应了无人机编队变化前后状态-动作空间维度的改变。此外,为了处理连续的状态和动作空间,我们采用了深度确定性策略梯度(DDPG)算法,这是一种基于行动者-评论家的 DRL 算法。更进一步,为了促进在变化发生时刻附近的学习探索,我们将原始的 DDPG 算法改造为异步并行计算(APC)结构,从而在评论家和行动者网络中均获得了更好的训练性能。最后,我们进行了广泛的仿真,以验证所提学习方法的收敛性,并展示了其在联合处理无人机编队和用户分布动态方面的能力,以及相对于被动反应方法的优越性。

关键词

引用

@article{arxiv.2108.11012,
  title  = {Responsive Regulation of Dynamic UAV Communication Networks Based on Deep Reinforcement Learning},
  author = {Ran Zhang and Duc Minh and Nguyen and Miao Wang and Lin X. Cai and Xuemin and Shen},
  journal= {arXiv preprint arXiv:2108.11012},
  year   = {2021}
}

备注

13 pages, book chapter, 25 (sub)figures