基于深度强化学习的 5G 移动用户网络下的 QoS 感知负载均衡
网络与互联网体系结构
2026-05-13 v3 系统与控制
系统与控制
摘要
高效的移动性管理和负载均衡是维持稠密、高度动态 5G 无线接入网络质量服务 (QoS) 的关键。我们提出了基于 Proximal Policy Optimization (PPO) 的深度强化学习框架,用于在纯 Python 模拟环境中实现的自主、QoS 感知负载均衡。该控制问题被建模为马尔可夫决策过程,其中智能体定期调整细胞个体偏移 (CIO) 值以引导用户-小区关联。在多目标奖励函数中捕获了关键绩效指标 (聚合吞吐量、延迟、抖动、丢包率、Jain 公平性指数和交接次数),使所学习的策略能够在用户移动和噪声观测条件下显式平衡效率和稳定性。PPO 智能体使用基于 actor-critic 神经网络的结构,通过 Python 模拟器生成的轨迹进行训练,模拟器支持可配置的移动模式(如高斯-马可夫模型)和随机测量噪声。在 500 多次训练剧集和不断增加用户密度的压力测试中,PPO 策略始终改善了 KPI 趋势(更高的吞吐量和公平性,更低的延迟、抖动、丢包和交接次数),并表现出快速、稳定的收敛。比较评估显示,PPO 在所有 KPI 上均优于基于规则的 ReBuHa 和 A3 以及基于学习的 CDQL 基线,同时保持更平滑的学习动力学和更强的泛化能力。这些结果表明,PPO 的裁剪策略更新和基于优势的训练为下一代 RAN 负载均衡提供了稳健、可部署的控制,同时使用完全基于 Python 的工具链。
引用
@article{arxiv.2510.24869,
title = {Deep Reinforcement Learning Approach to QoSAware Load Balancing in 5G Cellular Networks under User Mobility and Observation Uncertainty},
author = {Mehrshad Eskandarpour and Hossein Soleimani},
journal= {arXiv preprint arXiv:2510.24869},
year = {2026}
}