中文

无线无人机网络中用于轨迹设计的元强化学习

机器学习 2020-05-27 v1 信息论 网络与互联网体系结构 math.IT 机器学习

摘要

本文研究动态网络环境中能量受限无人机最优轨迹的设计问题。在所考虑的模型中,派遣一个无人机基站(DBS)为需求动态且不可预测的地表用户提供上行链路连接。在此情形下,DBS 的轨迹必须自适应调整以满足动态的用户接入请求。为此,提出一种元学习算法,通过在遇到新环境时调整强化学习(RL)方案,使 DBS 的轨迹适应新环境。该元学习算法基于有限的既往经验,提供可快速使 DBS 适应新环境的解决方案。与基线策略梯度算法相比,经元调谐的 RL 在未见环境中以相当低的计算复杂度更快地收敛到最优覆盖。仿真结果表明,与基线策略梯度算法相比,所提元学习方案在收敛速度上提升 25%,在 DBS 通信性能上提升约 10%。同时,与基线策略梯度算法相比,DBS 服务超过 50% 用户请求的概率提升约 27%。

关键词

引用

@article{arxiv.2005.12394,
  title  = {Meta-Reinforcement Learning for Trajectory Design in Wireless UAV Networks},
  author = {Ye Hu and Mingzhe Chen and Walid Saad and H. Vincent Poor and Shuguang Cui},
  journal= {arXiv preprint arXiv:2005.12394},
  year   = {2020}
}

备注

6 pages, Fig.4