中文

无探索学习联合波束成形RL策略:一种批量约束离屏策略方法

机器学习 2023-11-14 v2 人工智能 信号处理

摘要

在这项工作中,我们考虑用于速率最大化的网络参数优化问题。我们将其构建为功率控制、波束成形和干扰消除的联合优化问题。我们考虑多个基站(BS)与多个用户设备(UE)通信的设置。由于暴力搜索具有指数级计算复杂度,我们转而使用深度强化学习(RL)技术解决这一非凸优化问题。现代通信系统因其行为难以精确建模而众所周知。这限制了我们使用基于RL的算法,因为智能体需要与环境交互才能高效地探索和学习。此外,由于在真实世界中部署算法进行探索和学习会因失败成本高昂而不可取。与之前提出的基于RL的解决方案(如基于深度Q网络(DQN)的控制)相比,我们提出了一种离线的基于模型的方法。我们特别考虑离散批量约束深度Q学习(BCQ),并表明仅使用一小部分数据且无需探索即可达到与DQN相似的性能。这最大化了样本效率,并最小化了将新算法部署到商用网络中的风险。我们在以下链接提供整个项目资源,包括代码和数据:https://github.com/Heasung-Kim/safe-rl-deployment-for-5g。

关键词

引用

@article{arxiv.2310.08660,
  title  = {Learning RL-Policies for Joint Beamforming Without Exploration: A Batch Constrained Off-Policy Approach},
  author = {Heasung Kim and Sravan Kumar Ankireddy},
  journal= {arXiv preprint arXiv:2310.08660},
  year   = {2023}
}

备注

10 pages, 8 figures