中文

排队系统中学习的瞬态代价

机器学习 2025-04-08 v3 数据结构与算法 性能 概率论

摘要

排队系统是广泛适用的随机模型,在通信网络、医疗、服务系统等方面具有应用。尽管其最优控制已被广泛研究,但大多数现有方法假设对系统参数有完备认知。这一假设在存在参数不确定性的实际场景中很少成立,从而推动了近期关于排队系统赌博机学习(bandit learning)的研究。这一新兴研究方向聚焦于所提算法的渐近性能,却未揭示学习过程早期阶段的瞬态性能。本文提出排队中学习瞬态代价(Transient Cost of Learning in Queueing, TCLQ),一种量化由参数不确定性引起的平均排队长度最大增幅的新指标。我们刻画了单队列多服务器系统的 TCLQ,并将结果推广至多队列多服务器系统及排队网络。在建立结果的过程中,我们提出了一种统一的 TCLQ 分析框架,其桥接了 Lyapunov 分析与赌博机分析,为广泛算法提供保证,并可能具有独立意义。

关键词

引用

@article{arxiv.2308.07817,
  title  = {The Transient Cost of Learning in Queueing Systems},
  author = {Daniel Freund and Thodoris Lykouris and Wentao Weng},
  journal= {arXiv preprint arXiv:2308.07817},
  year   = {2025}
}

备注

A condensed preliminary version of this work, titled "Quantifying the Cost of Learning in Queueing Systems", was accepted for presentation at the Conference on Neural Information Processing Systems (NeurIPS 2023)