中文

LTE与Wi-Fi共存中的贝叶斯非参数强化学习

机器学习 2021-05-28 v2 信号处理

摘要

随着下一代无线通信的形成,物联网、自动驾驶汽车和无人机等越来越多新应用正涌入免授权频谱。长期演进(LTE)等授权网络也进入免授权频谱,以更低成本更好地提供高容量内容。然而,LTE并非为与他人共享频谱而设计。这些网络的合作中心成本高昂,因为它们具有异构特性且任何人可不受限制地进入和离开频谱,因此设计将具挑战性。由于用统一设计涵盖潜在无限场景不可行,一种替代方案是让每个网络学习自身的共存策略。先前方案仅适用于固定场景。本工作中提出一种强化学习算法,以应对5 GHz免授权频谱中Wi-Fi与LTE智能体的共存问题。该共存问题被建模为分散式部分可观测马尔可夫决策过程(Dec-POMDP),并采用贝叶斯方法以非参数先验进行策略学习,以适应不同智能体策略的不确定性。奖励函数中引入了公平性度量以鼓励智能体间公平共享。通过将值函数转化为似然并对后验近似进行变分推断,强化学习被转化为优化问题。仿真结果表明,该算法能以紧凑策略表示达到高值,且在应用于智能体集时保持计算高效。

关键词

引用

@article{arxiv.2105.12249,
  title  = {Bayesian Nonparametric Reinforcement Learning in LTE and Wi-Fi Coexistence},
  author = {Po-Kan Shih},
  journal= {arXiv preprint arXiv:2105.12249},
  year   = {2021}
}