基于安全加速深度强化学习的O-RAN切片:一种混合迁移学习方法
网络与互联网体系结构
2023-09-20 v2 人工智能
机器学习
摘要
开放无线接入网(O-RAN)架构支持智能网络控制算法作为其核心能力之一。数据驱动应用融合此类算法,通过RAN智能控制器(RICs)优化无线接入网(RAN)功能。深度强化学习(DRL)算法是O-RAN文献中用于解决动态无线资源管理问题的主要方法之一。然而,尽管O-RAN RICs带来了诸多益处,DRL算法在实际网络部署中的采用仍然滞后。这主要归因于DRL智能体在部署时以及遇到未见过的网络条件时所表现出的收敛缓慢与性能不稳定。在本文中,我们提出将迁移学习(TL)作为基于DRL的O-RAN功能闭环控制训练和部署工作流的核心组成部分,以应对这些挑战。为此,我们提出并设计了一种混合TL辅助方法,该方法利用策略复用和蒸馏TL方法的优势,在基于DRL的O-RAN切片中实现安全且加速的收敛。我们进行了涵盖多种服务的详尽实验,包括真实VR游戏流量以反映O-RAN切片的实际场景。我们还提出并实现了策略复用和蒸馏辅助DRL以及非TL辅助DRL作为三个独立基线。所提出的混合方法相比基线至少表现出:平均初始奖励值提升7.7%,收敛场景比例提升20.7%,奖励方差降低64.6%,同时保持快速收敛并增强了泛化能力。
引用
@article{arxiv.2309.07265,
title = {Safe and Accelerated Deep Reinforcement Learning-based O-RAN Slicing: A Hybrid Transfer Learning Approach},
author = {Ahmad M. Nagib and Hatem Abou-Zeid and Hossam S. Hassanein},
journal= {arXiv preprint arXiv:2309.07265},
year = {2023}
}
备注
This paper has been accepted for publication in a future issue of IEEE Journal on Selected Areas in Communications (JSAC)