中文

Pareto 确定性策略梯度及其在 5G 大规模 MIMO 网络中的应用

机器学习 2020-12-03 v1 网络与互联网体系结构

摘要

在本文中,我们考虑通过强化学习(RL)方法联合优化小区负载均衡与网络吞吐量,其中小区间切换(即用户关联分配)和大规模 MIMO 天线下倾被配置为待学习的 RL 策略。我们使用 RL 的动机是规避对用户移动性和网络动态进行解析建模的困难。为完成该联合优化,我们将向量奖励集成到 RL 值网络中,并通过独立的策略网络执行 RL 动作。我们将此方法命名为 Pareto 确定性策略梯度(PDPG)。它是一种 actor-critic、无模型且确定性的策略算法,能够处理耦合目标,具有以下两个优点:1)它利用向量奖励的自由度进行优化,而非选择手工设计的标量奖励;2)多个策略的交叉验证可显著减少。相应地,启用 RL 的网络以自组织方式运行:它通过测量历史学习潜在的用户移动性,从而在无需环境假设的情况下主动执行切换和天线下倾。我们的数值评估表明,所引入的 RL 方法优于基于标量奖励的方法。同时,为自成体系,我们包含一个基于理想静态优化的暴力搜索求解器作为基准。比较显示,RL 方法表现与这一理想策略相当,尽管前者受限于有限的环境观测和较低的动作频率,而后者可完全获知用户移动性。我们所提方法在不同用户移动性环境下的收敛性也基于来自真实场景的测量数据进行了测试。

关键词

引用

@article{arxiv.2012.01279,
  title  = {Pareto Deterministic Policy Gradients and Its Application in 5G Massive MIMO Networks},
  author = {Zhou Zhou and Yan Xin and Hao Chen and Charlie Zhang and Lingjia Liu},
  journal= {arXiv preprint arXiv:2012.01279},
  year   = {2020}
}