中文

DeepRMSA:一种用于弹性光网络中路由、调制与频谱分配的深度强化学习框架

网络与互联网体系结构 2019-09-04 v2 机器学习 信号处理

摘要

本文提出 DeepRMSA,一种用于弹性光网络(EONs)中路由、调制与频谱分配(RMSA)的深度强化学习框架。DeepRMSA 通过用可感知复杂 EON 状态的深度神经网络(DNNs)参数化策略来学习正确的在线 RMSA 策略。DNNs 使用动态光路径配置的经验和进行训练。我们首先改进异步优势 actor-critic 算法,并给出一种基于片段的 DeepRMSA 训练机制,即 DeepRMSA-EP。DeepRMSA-EP 将动态配置过程划分为多个片段(每个片段包含固定数量光路径请求的服务),并在每个片段结束时进行训练。DeepRMSA-EP 在服务请求的每一步的优化目标是在该片段剩余部分内最大化累积奖励。因此,我们避免了对与未知未来状态相关奖励的估计需求。为克服 DeepRMSA-EP 训练中因累积奖励振荡导致的不稳定性问题,我们进一步提出一种基于窗口的灵活训练机制,即 DeepRMSA-FLX。DeepRMSA-FLX 通过将每步的优化范围定义为滑动窗口,并确保累积奖励始终包含固定数量请求的奖励,来平滑振荡。在两种样本拓扑上的评估表明,与基线相比,DeepRMSA-FLX 能有效稳定训练,同时实现超过 20.3% 和 14.3% 的阻塞概率降低。

关键词

引用

@article{arxiv.1905.02248,
  title  = {DeepRMSA: A Deep Reinforcement Learning Framework for Routing, Modulation and Spectrum Assignment in Elastic Optical Networks},
  author = {Xiaoliang Chen and Baojia Li and Roberto Proietti and Hongbo Lu and Zuqing Zhu and S. J. Ben Yoo},
  journal= {arXiv preprint arXiv:1905.02248},
  year   = {2019}
}