面向无线网络功率控制的带目标确定性策略学习
网络与互联网体系结构
2019-02-22 v1 机器学习
机器学习
摘要
小区间干扰协调(ICIC)是一种提升无线网络能效的有前景的方法,尤其在小型基站密集部署的场景中。然而,传统的基于优化的 ICIC 方案在复杂干扰模式下性能严重下降。为解决此问题,我们提出一种用于无线网络中 ICIC 的带目标确定性策略深度强化学习(DRL-DPT)框架。DRL-DPT 克服了在无线网络中应用强化学习和深度学习的主要障碍,即连续状态空间、连续动作空间与收敛性。首先,引入深度神经网络(DNN)作为 actor 以在连续空间中获得确定性功率控制动作。随后,为保证收敛,提出了一种在线训练过程,其利用专门的奖励函数作为目标规则,并采用策略梯度下降算法调整 DNN 权重。实验结果表明,所提出的 DRL-DPT 框架在不同无线干扰场景下,在能效和吞吐量方面始终优于现有方案。更具体地,它将能效提升了至多 15%,且收敛速度更快。
引用
@article{arxiv.1902.07903,
title = {Learning Deterministic Policy with Target for Power Control in Wireless Networks},
author = {Yujiao Lu and Hancheng Lu and Liangliang Cao and Feng Wu and Daren Zhu},
journal= {arXiv preprint arXiv:1902.07903},
year = {2019}
}
备注
7 pages, 7 figures, GlobeCom2018