基于离散归一化优势函数的深度强化学习用于网络切片资源管理
机器学习
2019-06-12 v1 机器学习
摘要
网络切片有望在单一基础设施中提供具有不同需求的多样化服务。深度强化学习(例如深度 Q 学习,DQL)被认为是一种合适的算法,通过将变化的需求和分配的带宽分别视为环境状态和动作,来解决网络切片中需求感知的切片间资源管理问题。然而,以更细粒度分配带宽通常意味着更大的动作空间,不幸的是,DQL 在这种情况下无法快速收敛。本文中,我们将离散归一化优势函数(DNAF)引入 DQL,通过将 Q 值函数分离为状态值函数项和优势项,并利用确定性策略梯度下降(DPGD)算法,避免为每个状态-动作对计算不必要的 Q 值。此外,由于 DPGD 仅在连续动作空间中有效,我们将 k-最近邻算法嵌入 DQL,以在离散空间中快速找到最接近 DPGD 输出的有效动作。最后,我们通过大量仿真验证了基于 DNAF 的 DQL 具有更快的收敛速度。
引用
@article{arxiv.1906.04594,
title = {Deep Reinforcement Learning with Discrete Normalized Advantage Functions for Resource Management in Network Slicing},
author = {Chen Qi and Yuxiu Hua and Rongpeng Li and Zhifeng Zhao and Honggang Zhang},
journal= {arXiv preprint arXiv:1906.04594},
year = {2019}
}