中文

面向联合 O-RAN/MEC 编排的贝叶斯深度强化学习框架

网络与互联网体系结构 2023-12-27 v1 机器学习

摘要

多接入边缘计算 (MEC) 可与开放无线接入网 (O-RAN) 结合部署于通用平台,以实现低成本部署并将服务更贴近终端用户。本文提出了一种基于贝叶斯深度强化学习 (RL) 的联合 O-RAN/MEC 编排框架,该框架联合控制 O-RAN 功能分割、跨地理分布平台的 O-RAN/MEC 服务资源分配与托管位置,以及每条 O-RAN/MEC 数据流的路由。其目标是在适应可能时变的 O-RAN/MEC 需求和资源可用性的同时,最小化长期整体网络运营成本并最大化 MEC 性能指标。该编排问题被建模为马尔可夫决策过程 (MDP)。然而,系统包含多个共享相同资源并服务异构需求的基站 (BS),其参数间存在非平凡关系。因此,寻找底层系统的精确模型是不切实际的,且所构建的 MDP 具有巨大的状态空间和多维离散动作空间。为解决此类建模与维度问题,我们提出了一种用于解决方案框架的新型无模型 RL 智能体。该智能体基于双深度 Q 网络 (DDQN) 构建以应对大状态空间,并融合了动作分支技术——一种动作分解方法,能以线性增长的复杂度有效处理多维离散动作。此外,我们提出了一种在贝叶斯框架下利用汤普森采样 (Thompson sampling) 的高效探索 - 利用策略,以提升学习性能并加速收敛。基于符合 O-RAN 标准的模型进行了轨迹驱动仿真。结果表明,我们的方法具有数据高效性(即收敛更快),且相较于其非贝叶斯版本,返回的奖励提高了 32%。

关键词

引用

@article{arxiv.2312.16142,
  title  = {A Bayesian Framework of Deep Reinforcement Learning for Joint O-RAN/MEC Orchestration},
  author = {Fahri Wisnu Murti and Samad Ali and Matti Latva-aho},
  journal= {arXiv preprint arXiv:2312.16142},
  year   = {2023}
}

备注

This article is submitted to IEEE