中文

通过Bandit反馈学习调度在线任务

机器学习 2024-02-27 v1 分布式、并行与集群计算

摘要

在线任务调度在云计算和众包中对于任务密集型应用起着不可或缺的作用。在某种任务到达分布下,最优调度可以提升系统性能,通常以奖励成本比来衡量。一方面,奖励和成本都依赖于任务上下文(例如评估指标),并且在实践中是黑盒的。这使得奖励和成本难以建模,因此在决策前是未知的。另一方面,任务到达行为对诸如不可预测的系统波动等因素敏感,因此先验估计或传统的到达分布假设(例如泊松分布)可能失效。这意味着另一个实际但常被忽视的挑战,即不确定的任务到达分布。为了在具有各种不确定性的平稳环境下实现有效调度,我们提出了一种基于双乐观学习的Robbins-Monro(DOL-RM)算法。具体来说,DOL-RM集成了一个学习模块(包含对奖励成本比的乐观估计)和一个决策模块(利用Robbins-Monro方法在做出调度决策的同时隐式学习任务到达分布)。理论上,DOL-RM实现了收敛间隙和无遗憾学习,具有O(T3/4)O(T^{3/4})的次线性遗憾,这是在线任务调度在不确定任务到达分布和未知奖励与成本下的首个结果。我们在合成实验和实际应用中的数值结果表明,与其他最先进的基线相比,DOL-RM在实现最佳累积奖励成本比方面具有有效性。

关键词

引用

@article{arxiv.2402.16463,
  title  = {Learning to Schedule Online Tasks with Bandit Feedback},
  author = {Yongxin Xu and Shangshang Wang and Hengquan Guo and Xin Liu and Ziyu Shao},
  journal= {arXiv preprint arXiv:2402.16463},
  year   = {2024}
}

备注

16 pages