基于模型的残差策略学习及其在天线控制中的应用
机器学习
2023-09-12 v3 人工智能
系统与控制
系统与控制
摘要
不可微控制器和基于规则的策略被广泛用于控制真实系统,如电信网络和机器人。具体而言,移动网络基站天线的参数可由这些策略动态配置,以改善用户覆盖和服务质量。受天线倾角控制问题的启发,我们引入了基于模型的残差策略学习(MBRPL),一种实用的强化学习(RL)方法。MBRPL 通过基于模型的方法增强现有策略,与现成 RL 方法相比,提高了样本效率并减少了与实际环境的交互次数。据我们所知,这是首篇研究用于天线控制的基于模型方法的论文。实验结果表明,我们的方法在提供强劲初始性能的同时,相比先前 RL 方法提高了样本效率,这是将这些算法部署到真实网络中的一步。
引用
@article{arxiv.2211.08796,
title = {Model Based Residual Policy Learning with Applications to Antenna Control},
author = {Viktor Eriksson Möllerstedt and Alessio Russo and Maxime Bouton},
journal= {arXiv preprint arXiv:2211.08796},
year = {2023}
}