单服务器排队系统中基于学习的最优准入控制
最优化与控制
2023-11-27 v2 机器学习
摘要
我们考虑一个 M/M/1 排队系统中的长期平均利润最大化准入控制问题,其中服务率和到达率未知。在服务完成时获得固定奖励,且对在队列中等待的顾客按单位时间收取费用的设定下,调度器根据系统队列长度的完整观测历史,在到达时决定是否接纳到达的顾客。Naor (1969, Econometrica) 证明了,如果模型的所有参数已知,则采用静态阈值策略是最优的——即如果队列长度小于预定阈值则接纳,否则不接纳。我们提出了一种基于学习的调度算法,并刻画了其相对于 Naor (1969) 的全信息模型中最优调度策略的遗憾。我们证明,当全信息下的所有最优阈值均非零时,该算法实现了 的遗憾;而在全信息下的最优阈值为 0(即最优策略为拒绝所有到达)的情形下,对于任意给定的 ,算法实现了 的遗憾,其中 为到达顾客数。
关键词
引用
@article{arxiv.2212.11316,
title = {Learning-based Optimal Admission Control in a Single Server Queuing System},
author = {Asaf Cohen and Vijay G. Subramanian and Yili Zhang},
journal= {arXiv preprint arXiv:2212.11316},
year = {2023}
}