基于深度强化学习的调度型 eMBB 流量之上 URLLC 数据管理
信号处理
2026-03-16 v1 机器学习
摘要
随着 5G 的出现以及对超越 5G (B5G) 网络的研究,一个新颖且非常相关的研究课题是如何管理不同类型流量的共存,每种流量都有极其严格但完全不同的需求。在本文中,我们提出一种深度强化学习 (DRL) 算法,以在超可靠低时延通信 (URLLC) 与增强移动宽带 (eMBB) 流量之间切分可用的物理层资源。具体而言,在我们的设定中,时频资源栅格被 eMBB 流量完全占用,我们训练 DRL 智能体采用近端策略优化 (PPO)(一种最先进的 DRL 算法)通过打孔 eMBB 码字来动态分配 incoming URLLC 流量。假设每个 eMBB 码字可容忍一定量的有限打孔,超过则处于中断,我们表明 DRL 智能体所设计的策略从不违反 URLLC 流量的时延要求,同时与其他最先进方案相比,将处于中断的 eMBB 码字数量维持在最低水平。
引用
@article{arxiv.2103.01801,
title = {Deep Reinforcement Learning for URLLC data management on top of scheduled eMBB traffic},
author = {Fabio Saggese and Luca Pasqualini and Marco Moretti and Andrea Abrardo},
journal= {arXiv preprint arXiv:2103.01801},
year = {2026}
}
备注
This work has been submitted to the IEEE for possible publication