中文

面向O-RAN中延迟感知RAN切片的百分位基深度强化学习与奖励驱动的个人化

机器学习 2025-07-25 v1

摘要

本文聚焦于开放式无线接入网络(O-RAN)中RAN切片的挑战。我们的工作聚焦于包含多个移动虚拟网络运营商(MVNO)的网络,这些运营商竞争获取物理资源块(PRBs),目标是在满足其客户的概率延迟上限约束的同时,最小化PRBs的利用率。首先,我们基于大数律(LLN)推导奖励函数,然后进行实用修改以适应实际实验场景。随后,我们提出解决方案——基于百分位的延迟感知深度强化学习(PDA-DRL),其在多个基线模型(包括针对平均延迟约束优化的DRL模型)上取得显著优势,实现了38%的平均延迟降低。此外,我们深入探讨了多个MVNO之间模型权重共享的问题,以开发稳健的个人化模型。我们引入一种基于奖励的个人化方法,其中每个智能体根据其他智能体的性能优先级排序其模型权重。该技术超越了传统聚合方法(如联邦平均)以及依赖流量模式和模型权重距离相似性的策略。

关键词

引用

@article{arxiv.2507.18111,
  title  = {Percentile-Based Deep Reinforcement Learning and Reward Based Personalization For Delay Aware RAN Slicing in O-RAN},
  author = {Peyman Tehrani and Anas Alsoliman},
  journal= {arXiv preprint arXiv:2507.18111},
  year   = {2025}
}