中文

面向在线随机排队网络优化的干预辅助策略梯度方法: 技术报告

人工智能 2024-04-08 v1 机器学习

摘要

深度强化学习(DRL)为训练随机排队网络(SQN)的神经网络控制策略提供了一种强大的方法。然而,传统的DRL方法依赖于离线模拟或静态数据集,限制了它们在SQN控制中的实际应用。本文提出在线深度强化学习控制(ODRLC)作为一种替代方案,其中智能体直接与现实环境交互,并从这些在线交互中学习最优控制策略。由于网络中队列的无界性导致状态空间无界,SQN给ODRLC带来了挑战。无界状态空间对神经网络策略尤其具有挑战性,因为神经网络在推断未见状态方面出了名的差。为应对这一挑战,我们提出了一个干预辅助框架,该框架利用来自已知稳定策略的策略性干预来确保队列大小保持有界。该框架结合了神经网络的学习能力与SQN经典控制策略的保证稳定性。我们引入了一种设计这些干预辅助策略的方法,以确保网络的强稳定性。此外,我们为基础DRL定理扩展了干预辅助策略,并专门为SQN的ODRLC开发了两种实用算法。最后,我们通过实验证明,我们提出的算法在性能上优于经典控制方法和先前的ODRLC算法。

关键词

引用

@article{arxiv.2404.04106,
  title  = {Intervention-Assisted Policy Gradient Methods for Online Stochastic Queuing Network Optimization: Technical Report},
  author = {Jerrod Wigmore and Brooke Shrader and Eytan Modiano},
  journal= {arXiv preprint arXiv:2404.04106},
  year   = {2024}
}

备注

25 pages, 6 Figures