中文

基于多智能体强化学习的 O-RAN 资源管理:任务特定锐度感知优化

人工智能 2025-11-20 v1 机器学习

摘要

下一代网络利用 Open Radio Access Network(O-RAN)架构实现动态资源管理,由 RAN Intelligent Controller(RIC)促进。虽然深度强化学习(DRL)模型在优化网络资源方面显示出前景,但它们在动态环境中常面临鲁棒性和可推广性方面的挑战。本文引入一种新颖的资源管理方法,通过将锐度感知最小化(SAM)与 Soft Actor Critic(SAC)算法相结合,构建分布式多智能体 RL(MARL)框架。我们的方法引入一种自适应和选择性 SAM 机制,其中正则化明确由时序差分(TD)误差方差驱动,确保只有面临高环境复杂度的智能体才进行正则化。这一有针对性的策略减少了不必要的开销,提高了训练稳定性,并在不牺牲学习效率的前提下提升了泛化能力。我们进一步纳入动态 ρ\rho 调度方案,以细化代理间的探索-开发权衡。实验结果表明,我们的方法显著优于常规 DRL 方法,实现了资源分配效率提升约 22%,并在 diverse O-RAN 切片中确保了优异的 QoS 满足度。

关键词

引用

@article{arxiv.2511.15002,
  title  = {Task Specific Sharpness Aware O-RAN Resource Management using Multi Agent Reinforcement Learning},
  author = {Fatemeh Lotfi and Hossein Rajoli and Fatemeh Afghah},
  journal= {arXiv preprint arXiv:2511.15002},
  year   = {2025}
}

备注

Accepted to be published in IEEE Transaction on Machine Learning in Communication and Networking (TMLCN)