基于多智能体深度强化学习的 5G 毫米波网络能效睡眠模式优化
机器学习
2025-12-01 v1 最优化与控制
概率论
机器学习
摘要
毫米波(mmWave)网络中动态睡眠模式优化(SMO)对于在严格的质量服务(QoS)约束下最大化能源效率(EE)至关重要。然而,现有优化和强化学习(RL)方法依赖于聚合的、静态基站(BS)流量模型,无法捕捉非平稳流量动态,且受限于大型状态-动作空间,限制了实际部署。为此,本文提出一种基于多智能体深度强化学习(MARL)的框架,使用 Double Deep Q-Network(DDQN),称为 MARL-DDQN,用于 3D 城市环境中基于时间变化和社区的基站用户设备(UE)移动性模型的自适应 SMO。不同于传统单智能体 RL,MARL-DDQN 实现可扩展的、分布式决策,最小化信令开销。集成现实的 BS 功耗模型和波束赋形,以准确量化 EE,而 QoS 以吞吐量为定义。该方法可针对最大化 EE 进行 SMO 策略调整,同时减轻细胞间干扰并确保吞吐公平性。仿真结果表明,MARL-DDQN 在能源效率、10 分位吞吐量和 QoS 约束满足率等方面均优于当前最先进策略,包括全开启、迭代 QoS 感知负载基于(IT-QoS-LB)、MARL-DDPG 和 MARL-PPO,分别实现了最高 0.60 Mbit/Joule 的能效、8.5 Mbps 的 10 分位吞吐量以及在动态场景下 95% 的 QoS 约束满足率。
引用
@article{arxiv.2511.22104,
title = {Representative Action Selection for Large Action Space: From Bandits to MDPs},
author = {Quan Zhou and Shie Mannor},
journal= {arXiv preprint arXiv:2511.22104},
year = {2025}
}
备注
Journal version of arXiv:2505.18269