中文

强化学习还是非强化学习?基于AI的无线电资源管理算法速查表

网络与互联网体系结构 2024-05-31 v2

摘要

几个无线电资源管理(RRM)用例可以表述为顺序决策规划问题,其中智能体(通常是基站)做出影响网络效用和状态的决策。虽然强化学习(RL)的一般形式可以解决这种情况,但已知其样本效率低下。遵循奥卡姆剃刀原则,我们认为RRM解决方案技术的选择应基于以下问题:“是短期还是长期规划问题?”、“底层模型已知还是需要学习?”、“我们能解析地解决问题吗?”或“是否有专家设计的策略可用?”存在多种技术来解决这些问题,包括静态和随机优化、bandits、模型预测控制(MPC)以及RL。我们回顾了一些已成功应用于RRM的技术,并相信其他技术,如MPC,可能为未来提供令人兴奋的研究机会。

关键词

引用

@article{arxiv.2405.19045,
  title  = {To RL or not to RL? An Algorithmic Cheat-Sheet for AI-Based Radio Resource Management},
  author = {Lorenzo Maggi and Matthew Andrews and Ryo Koblitz},
  journal= {arXiv preprint arXiv:2405.19045},
  year   = {2024}
}