无人机辅助网络中基于神经组合深度强化学习的年龄最优联合轨迹与调度设计
信息论
2020-06-30 v1 math.IT
摘要
本文考虑一个无人机(UAV)辅助的无线网络,其中假设一个受电池约束的无人机飞向受能量约束的地面节点以接收其观测过程的状况更新。以最小化无人机处不同物理过程的信息年龄(NWAoI)归一化加权和值为目标,联合优化无人机的飞行轨迹与状况更新调度。该问题首先被建模为一个混合整数规划。然后,对于给定的调度策略,提出一种基于凸优化的求解方法以推导无人机的最优飞行轨迹与更新时刻。然而,由于所建模问题的组合性质,寻找最优调度策略具有挑战性。因此,为补充所提基于凸优化的解,采用有限时域马尔可夫决策过程(MDP)来寻找最优调度策略。由于 MDP 的状态空间极其庞大,提出一种使用深度 Q 网络(DQN)的基于神经组合的深度强化学习(NCRL)新算法以获取最优策略。但是,对于具有大量节点的规模化场景,DQN 架构无法有效学习最优调度策略。受此驱动,提出一种基于长短期记忆(LSTM)的自编码器,在此类大规模场景中将状态空间映射为固定大小的向量表示。解析推导了最小 NWAoI 的下界,为不同节点重要性权重的恰当选取提供了系统设计准则。数值结果还表明,与基于权重和离散化状态 DQN 策略等基线策略相比,所提 NCRL 方法能显著改善每个过程的可达 NWAoI。
引用
@article{arxiv.2006.15863,
title = {Neural Combinatorial Deep Reinforcement Learning for Age-optimal Joint Trajectory and Scheduling Design in UAV-assisted Networks},
author = {Aidin Ferdowsi and Mohamed A. Abd-Elmagid and Walid Saad and Harpreet S. Dhillon},
journal= {arXiv preprint arXiv:2006.15863},
year = {2020}
}