中文

基于平均奖赏强化学习的多运营商NFV网络服务委托

网络与互联网体系结构 2021-12-28 v1

摘要

在多运营商5G/6G网络中,服务委托使管理域能够在提供NFV网络服务时实现联合。准入控制在不预先知晓服务请求统计分布的情况下,对选择适当部署域以最大化平均收益至关重要。本文以多种方式分析了服务委托的通用联邦合约模型。首先,在系统动态已知的假设下,我们将准入控制问题建模为无限 horizon 马尔可夫决策过程(MDP)并通过动态规划求解,从而得到理论最优性能界。其次,当到达与离开率未知时,我们应用强化学习来实际处理该问题。由于Q-learning最大化折扣奖赏,我们证明其因对折扣因子敏感而非高效解。随后,我们提出平均奖赏强化学习方法(R-Learning)以寻找直接最大化平均收益的策略。最后,我们通过大量仿真并使用5Growth平台进行实验来评估不同方案。结果证实所提R-Learning方案始终优于Q-Learning与贪婪策略。此外,在理想仿真环境中最优性差距至多9%,而在实验评估中其与MDP解相竞争。

关键词

引用

@article{arxiv.2112.13093,
  title  = {Multi-Provider NFV Network Service Delegation via Average Reward Reinforcement Learning},
  author = {Bahador Bakhshi and Josep Mangues-Bafalluy and Jorge Baranda},
  journal= {arXiv preprint arXiv:2112.13093},
  year   = {2021}
}