中文

NOMA-URLLC网络中用于上行调度的深度强化学习

网络与互联网体系结构 2023-08-29 v1 人工智能

摘要

本文探讨无线网络中的超可靠低时延通信(URLLC)问题,该框架受到来自不同领域众多物联网(IoT)应用所施加的特别严苛的约束。我们提出一种新颖的深度强化学习(DRL)调度算法,名为NOMA-PPO,用于解决涉及严格截止时间的非正交多址(NOMA)上行URLLC调度问题。在NOMA系统中满足上行URLLC要求的挑战在于:由于可调度多个设备,动作空间具有组合复杂性;以及我们为算法施加的部分可观测约束,以满足物联网通信约束并具备可扩展性。我们的方法包括:1)将NOMA-URLLC问题建模为部分可观测马尔可夫决策过程(POMDP),并引入智能体状态作为过去观测与动作的充分统计量,从而将POMDP转化为马尔可夫决策过程(MDP);2)调整近端策略优化(PPO)算法以处理组合动作空间;3)通过引入贝叶斯策略将先验知识融入学习智能体。数值结果表明,我们的方法不仅在3GPP场景下优于传统多址协议与DRL基准,而且在不同信道与业务配置下均表现出鲁棒性,有效利用了内在的时间相关性。

关键词

引用

@article{arxiv.2308.14523,
  title  = {Deep Reinforcement Learning for Uplink Scheduling in NOMA-URLLC Networks},
  author = {Benoît-Marie Robaglia and Marceau Coupechoux and Dimitrios Tsilimantos},
  journal= {arXiv preprint arXiv:2308.14523},
  year   = {2023}
}

备注

35 pages, 11 figures, under review at the IEEE Transactions on Machine Learning in Communications and Networking journal