中文

单服务器排队系统中基于学习的最优准入控制

最优化与控制 2023-11-27 v2 机器学习

摘要

我们考虑一个 M/M/1 排队系统中的长期平均利润最大化准入控制问题,其中服务率和到达率未知。在服务完成时获得固定奖励,且对在队列中等待的顾客按单位时间收取费用的设定下,调度器根据系统队列长度的完整观测历史,在到达时决定是否接纳到达的顾客。Naor (1969, Econometrica) 证明了,如果模型的所有参数已知,则采用静态阈值策略是最优的——即如果队列长度小于预定阈值则接纳,否则不接纳。我们提出了一种基于学习的调度算法,并刻画了其相对于 Naor (1969) 的全信息模型中最优调度策略的遗憾。我们证明,当全信息下的所有最优阈值均非零时,该算法实现了 O(1)O(1) 的遗憾;而在全信息下的最优阈值为 0(即最优策略为拒绝所有到达)的情形下,对于任意给定的 ϵ>0\epsilon>0,算法实现了 O(ln1+ϵ(N))O(\ln^{1+\epsilon}(N)) 的遗憾,其中 NN 为到达顾客数。

关键词

引用

@article{arxiv.2212.11316,
  title  = {Learning-based Optimal Admission Control in a Single Server Queuing System},
  author = {Asaf Cohen and Vijay G. Subramanian and Yili Zhang},
  journal= {arXiv preprint arXiv:2212.11316},
  year   = {2023}
}