超稠密无人机网络中的动态轨迹与功率控制:基于均场强化学习的方法
系统与控制
2024-11-22 v1 系统与控制
摘要
在超稠密无人机(UAV)网络中,协调大规模UAV之间资源分配和干扰管理,以为地面用户(GUs)提供灵活且高效的服务覆盖具有挑战性。在本文中,我们提出一种基于学习的资源分配方案,用于超稠密UAV通信网络,其中地面用户的服务需求呈时间可变且分布未知。我们将多个协通UAV的非合作博弈建模为随机博弈,每个UAV联合优化其轨迹、用户关联和下行功率控制,以最大化其在干扰和能源约束下的本地累计能效预期。为了应对大规模网络中的可扩展性问题,我们进一步将问题建模为均场博弈(MFG),将UAV之间的相互作用简化为代表UAV与均场之间的两人博弈。我们证明了MFG的均衡存在唯一性,并提出一种名为最大熵均场深度Q网络(maximum entropy mean-field deep Q network, ME-MFDQN)的模型无监督均场强化学习算法,用于求解MFG在完全和部分可观测情景下的均场均衡。仿真结果表明,所提出的算法在常用基准算法的能效方面具有优势;此外,如果GUs的服务需求具有更高的时相关性,或UAV对附近GUs的观察范围更广,性能还能进一步提升。
引用
@article{arxiv.2411.14052,
title = {Dynamic Trajectory and Power Control in Ultra-Dense UAV Networks: A Mean-Field Reinforcement Learning Approach},
author = {Fei Song and Zhe Wang and Jun Li and Long Shi and Wen Chen and Shi Jin},
journal= {arXiv preprint arXiv:2411.14052},
year = {2024}
}