中文

一种用于上行NOMA-URLLC网络资源分配的可靠强化学习

信息论 2022-01-19 v1 math.IT

摘要

在本文中,我们提出一种深度状态-动作-奖励-状态-动作(SARSA)λ\lambda学习方法,用于优化非正交多址(NOMA)辅助的超可靠低时延通信(URLLC)中的上行资源分配。为在时变网络环境中降低平均解码错误概率,本工作设计了一种可靠学习算法以提供长期资源分配,其中奖励反馈基于瞬时网络性能。在所提算法的辅助下,本文解决了NOMA-URLLC网络中可靠资源共享的三个主要挑战:1)用户聚类;2)瞬时反馈系统;3)最优资源分配。所有这些设计均与所考虑的通信环境交互。最后,我们将所提算法的性能与传统Q学习和SARSA Q学习算法进行比较。仿真结果表明:1)与传统Q学习算法相比,所提方案能够在200轮内收敛,提供低至10210^{-2}的长期平均错误;2)NOMA辅助的URLLC在解码错误概率方面优于传统OMA系统;3)所提反馈系统对长期学习过程高效。

关键词

引用

@article{arxiv.2201.06027,
  title  = {A Reliable Reinforcement Learning for Resource Allocation in Uplink NOMA-URLLC Networks},
  author = {Waleed Ahsan and Wenqiang Yi and Yuanwei Liu and Arumugam Nallanathan},
  journal= {arXiv preprint arXiv:2201.06027},
  year   = {2022}
}

备注

32 pages, 8 figures