基于策略梯度深度强化学习的 RSS 驱动无人机基站三维移动管理
信息论
2021-03-16 v1 math.IT
摘要
我们解决了自主无人机搭载基站(UAV-BS)的移动管理问题,该基站为地面上的一簇用户提供服务,而簇的地理特征(如位置和边界)、用户的地理位置以及无线环境特征均未知。UAV-BS 仅利用来自用户的接收信号强度(RSS)并据此选择其(连续)三维速度来进行建设性导航,即提升传输数据速率。为弥补模型缺失,我们采用策略梯度深度强化学习。由于我们的方法不依赖于关于用户及无线环境的任何特定信息,它具有灵活性并尊重隐私关切。我们的实验表明,尽管可用信息极少,UAV-BS 仍能够区分高层(通常非视距主导)与郊区(主要视距主导)环境,从而在前者(相应后者)中倾向于降低(相应增加)其高度并靠近(相应远离)簇。我们进一步观察到,奖励函数的选择影响了智能体遵守问题约束的速度与能力,而不影响所交付的数据速率。
引用
@article{arxiv.2103.08034,
title = {RSS-Based UAV-BS 3-D Mobility Management via Policy Gradient Deep Reinforcement Learning},
author = {Mohammad Ghadir Khoshkholgh and Halim Yanikomeroglu},
journal= {arXiv preprint arXiv:2103.08034},
year = {2021}
}