通过安全强化学习进行远程电调倾角优化
机器学习
2021-01-18 v2
摘要
远程电调倾角(RET)优化是一种调整基站(BS)天线垂直倾角以优化网络关键性能指标(KPI)的高效方法。强化学习(RL)因其自学习能力和对环境变化的适应性,为 RET 优化提供了强大的框架。然而,RL 智能体在交互过程中可能执行不安全的动作,即导致不期望的网络性能退化的动作。由于服务的可靠性对移动网络运营商(MNO)至关重要,性能退化的可能性阻碍了 RL 方法在 RET 优化中的实际部署。在这项工作中,我们在安全强化学习(SRL)框架下对 RET 优化问题建模,目标是学习一个相对于安全基线能提供性能改进保证的倾角控制策略。我们利用一种近期的 SRL 方法,即通过基线自举的安全策略改进(SPIBB),从由安全基线收集的交互离线数据集中学习改进策略。我们的实验表明,所提方法能够学习到安全且改进的倾角更新策略,提供了更高的可靠性和实际网络部署的潜力。
引用
@article{arxiv.2010.05842,
title = {Remote Electrical Tilt Optimization via Safe Reinforcement Learning},
author = {Filippo Vannella and Grigorios Iakovidis and Ezeddin Al Hakim and Erik Aumayr and Saman Feghhi},
journal= {arXiv preprint arXiv:2010.05842},
year = {2021}
}