异构排队系统中作业路由的高效强化学习
机器学习
2024-04-23 v2 性能
摘要
我们考虑将到达中心队列的作业高效路由到异构服务器系统的问题。与同构系统不同,对于一快一慢的两服务器系统,已知一种阈值策略是最优的,该策略在队列长度超过某个阈值时将作业路由到慢速服务器。但对于多服务器系统,最优策略是未知的,且难以找到。虽然强化学习(RL)被认为在此类情况下学习策略具有巨大潜力,但我们的问题具有指数级大的状态空间大小,这使得标准RL效率低下。在这项工作中,我们提出了ACHQ,这是一种基于策略梯度的高效算法,具有低维软阈值策略参数化,利用了底层的排队结构。我们为一般情况提供了稳定点收敛保证,并且尽管参数化维度较低,我们证明了ACHQ对于两服务器的特殊情况收敛到近似全局最优。仿真结果表明,与将作业路由到最快可用服务器的贪婪策略相比,预期响应时间最多可提高约30%。
引用
@article{arxiv.2402.01147,
title = {Efficient Reinforcement Learning for Routing Jobs in Heterogeneous Queueing Systems},
author = {Neharika Jali and Guannan Qu and Weina Wang and Gauri Joshi},
journal= {arXiv preprint arXiv:2402.01147},
year = {2024}
}
备注
AISTATS 2024; Corrected typos