中文

具有碰撞避免与切换感知小区关联的多无人机速度控制:基于动作分支的深度强化学习

机器学习 2024-01-23 v2 机器人学 系统与控制 系统与控制

摘要

本文提出一种深度强化学习方案,用于在三维空中高速公路上优化多无人机的小区关联决策及其移动速度。目标是提升运输与通信性能,包括碰撞避免、连通性与切换。该问题被建模为马尔可夫决策过程(MDP),其中无人机状态由速度与通信数据率定义。我们提出一种具有共享决策模块与多个网络分支的神经网络架构,每个分支专用于二维运输-通信空间中的特定动作维度。该设计高效处理多维动作空间,使各动作维度相互独立。我们引入两种模型——分支对决 Q 网络(BDQ)与分支对决双重深度 Q 网络(Dueling DDQN)——以展示该方法。仿真结果显示相较现有基准有 18.32% 的显著提升。

关键词

引用

@article{arxiv.2307.13158,
  title  = {Multi-UAV Speed Control with Collision Avoidance and Handover-aware Cell Association: DRL with Action Branching},
  author = {Zijiang Yan and Wael Jaafar and Bassant Selim and Hina Tabassum},
  journal= {arXiv preprint arXiv:2307.13158},
  year   = {2024}
}

备注

IEEE Globecom 2023 Accepted