中文

学习最优天线倾角控制策略:一种上下文线性 Bandit 方法

机器学习 2022-01-07 v1

摘要

在蜂窝网络中控制天线倾角对于实现网络覆盖与容量之间的有效权衡至关重要。在本文中,我们设计了从现有数据(即所谓的被动学习设置)或算法主动生成的数据(主动学习设置)中学习最优倾角控制策略的算法。我们将此类算法的设计形式化为上下文线性多臂 Bandit(CL-MAB)中的最优策略辨识(BPI)问题。一个臂代表一次天线倾角更新;上下文捕捉当前网络状况;奖励对应于性能提升,混合了覆盖与容量;目标是以便给定置信水平识别一个近似最优策略(一个将上下文映射到具有最大奖励的臂的函数)。对于主动与被动学习设置下的 CL-MAB,我们推导了任何以给定确定性返回近似最优策略的算法所需样本数的信息论下界,并设计了达到这些基本极限的算法。我们将算法应用于蜂窝网络中的远程电调倾角(RET)优化问题,并表明它们可以使用比朴素或现有基于规则的学习算法少得多的数据样本来生成最优倾角更新策略。

关键词

引用

@article{arxiv.2201.02169,
  title  = {Learning Optimal Antenna Tilt Control Policies: A Contextual Linear Bandit Approach},
  author = {Filippo Vannella and Alexandre Proutiere and Yassir Jedra and Jaeseong Jeong},
  journal= {arXiv preprint arXiv:2201.02169},
  year   = {2022}
}