中文

异构排队系统中作业路由的高效强化学习

机器学习 2024-04-23 v2 性能

摘要

我们考虑将到达中心队列的作业高效路由到异构服务器系统的问题。与同构系统不同,对于一快一慢的两服务器系统,已知一种阈值策略是最优的,该策略在队列长度超过某个阈值时将作业路由到慢速服务器。但对于多服务器系统,最优策略是未知的,且难以找到。虽然强化学习(RL)被认为在此类情况下学习策略具有巨大潜力,但我们的问题具有指数级大的状态空间大小,这使得标准RL效率低下。在这项工作中,我们提出了ACHQ,这是一种基于策略梯度的高效算法,具有低维软阈值策略参数化,利用了底层的排队结构。我们为一般情况提供了稳定点收敛保证,并且尽管参数化维度较低,我们证明了ACHQ对于两服务器的特殊情况收敛到近似全局最优。仿真结果表明,与将作业路由到最快可用服务器的贪婪策略相比,预期响应时间最多可提高约30%。

关键词

引用

@article{arxiv.2402.01147,
  title  = {Efficient Reinforcement Learning for Routing Jobs in Heterogeneous Queueing Systems},
  author = {Neharika Jali and Guannan Qu and Weina Wang and Gauri Joshi},
  journal= {arXiv preprint arXiv:2402.01147},
  year   = {2024}
}

备注

AISTATS 2024; Corrected typos