基于缓冲区状态信息的上行多载波非正交多址资源分配深度强化学习
网络与互联网体系结构
2022-09-01 v1 机器学习
系统与控制
系统与控制
摘要
对于正交多址(OMA)系统,可服务的用户设备(UE)数量受限于可用正交资源的数量。另一方面,非正交多址(NOMA)方案允许多个 UE 使用同一正交资源。这一额外的自由度给资源分配带来了新的挑战。缓冲区状态信息(BSI),如等待传输的数据包的大小与年龄,可用于改进 OMA 系统中的调度。本文中,我们研究了在具有不同数据速率与延迟需求的 UE 的上行多载波 NOMA 场景中,BSI 对集中式调度器性能的影响。为处理将 UE 分配到资源的巨大组合空间,我们提出了一种基于 actor-critic 强化学习并结合 BSI 的新颖调度器。训练与评估使用诺基亚的“wireless suite”进行。我们提出了多种新颖技术以稳定并加速训练。所提调度器优于基准调度器。
引用
@article{arxiv.2208.14689,
title = {Deep Reinforcement Learning for Uplink Multi-Carrier Non-Orthogonal Multiple Access Resource Allocation Using Buffer State Information},
author = {Eike-Manuel Bansbach and Yigit Kiyak and Laurent Schmalen},
journal= {arXiv preprint arXiv:2208.14689},
year = {2022}
}
备注
accepted for publication at European Wireless 2022