中文

用于 IRS 辅助 MU-MIMO 系统的深度上下文赌博机与强化学习

信息论 2024-01-31 v1 信号处理 math.IT

摘要

多输入多输出 (MIMO) 系统与智能反射面 (IRS) 的结合被预见为超 5G (B5G) 和 6G 的关键使能技术。在这项工作中,我们考虑了两种不同的方法,用于联合优化 IRS 辅助的多流 (MS) 多用户 MIMO (MU-MIMO) 系统的 IRS 相移矩阵和 MIMO 预编码器。两种方法都旨在最大化每个信道实现下的系统和速率。第一个提出的解决方案是一个新颖的具有连续状态和动作空间的上下文赌博机 (CB) 框架,称为深度上下文赌博机导向的深度确定性策略梯度 (DCB-DDPG)。第二个是一种创新的深度强化学习 (DRL) 公式,其中状态、动作和奖励的选择使得强化学习 (RL) 的马尔可夫决策过程 (MDP) 属性得到适当满足。在高多用户干扰的场景中,两种方案的性能都显著优于最先进的启发式方法。

关键词

引用

@article{arxiv.2401.16901,
  title  = {Deep Contextual Bandit and Reinforcement Learning for IRS-Assisted MU-MIMO Systems},
  author = {Dariel Pereira-Ruisánchez and Óscar Fresnedo and Darian Pérez-Adán and Luis Castedo},
  journal= {arXiv preprint arXiv:2401.16901},
  year   = {2024}
}