中文

通过在线学习调度多服务器作业以实现次线性后悔

分布式、并行与集群计算 2023-08-08 v2

摘要

请求多种计算资源并在执行期间持续占用的多服务器作业主导了现代计算集群。在在线场景中同时将多类资源分配给若干共置的多服务器作业时,除作业间的资源竞争外,难以在并行计算收益与内部通信开销之间做出权衡。为研究计算-通信权衡,我们将计算收益建模为作业在多个计算实例上并行执行时完成时间的加速,并以不同凹性效用函数拟合之;同时将主导的通信开销作为待扣除的惩罚。为获得更优的收益-开销权衡,我们构建累积奖励最大化规划并设计名为OGASched的在线算法来调度多服务器作业。OGASched沿奖励梯度递增方向将多类资源分配给每个到达的作业。它具有若干并行子流程以加速计算,大幅降低复杂度。我们证明其具有一般凹性奖励下的次线性后悔。我们还进行了广泛的轨迹驱动仿真以验证OGASched的性能。结果表明,OGASched分别优于广泛使用的启发式算法11.33%11.33\%7.75%7.75\%13.89%13.89\%13.44%13.44\%

关键词

引用

@article{arxiv.2305.06572,
  title  = {Scheduling Multi-Server Jobs with Sublinear Regrets via Online Learning},
  author = {Hailiang Zhao and Shuiguang Deng and Zhengzhe Xiang and Xueqiang Yan and Jianwei Yin and Schahram Dustdar and Albert Y. Zomaya},
  journal= {arXiv preprint arXiv:2305.06572},
  year   = {2023}
}