中文

面向无线网络功率控制的带目标确定性策略学习

网络与互联网体系结构 2019-02-22 v1 机器学习 机器学习

摘要

小区间干扰协调(ICIC)是一种提升无线网络能效的有前景的方法,尤其在小型基站密集部署的场景中。然而,传统的基于优化的 ICIC 方案在复杂干扰模式下性能严重下降。为解决此问题,我们提出一种用于无线网络中 ICIC 的带目标确定性策略深度强化学习(DRL-DPT)框架。DRL-DPT 克服了在无线网络中应用强化学习和深度学习的主要障碍,即连续状态空间、连续动作空间与收敛性。首先,引入深度神经网络(DNN)作为 actor 以在连续空间中获得确定性功率控制动作。随后,为保证收敛,提出了一种在线训练过程,其利用专门的奖励函数作为目标规则,并采用策略梯度下降算法调整 DNN 权重。实验结果表明,所提出的 DRL-DPT 框架在不同无线干扰场景下,在能效和吞吐量方面始终优于现有方案。更具体地,它将能效提升了至多 15%,且收敛速度更快。

关键词

引用

@article{arxiv.1902.07903,
  title  = {Learning Deterministic Policy with Target for Power Control in Wireless Networks},
  author = {Yujiao Lu and Hancheng Lu and Liangliang Cao and Feng Wu and Daren Zhu},
  journal= {arXiv preprint arXiv:1902.07903},
  year   = {2019}
}

备注

7 pages, 7 figures, GlobeCom2018