以优化成功作业驻留时间为目标的调度
性能
2022-09-30 v2
摘要
深度神经网络训练作业及其他迭代计算频繁包含检查点,作业可基于受监控指标的当前值在这些检查点被取消。虽然大多数现有结果关注所有作业(成功完成与被取消者)的性能,本文探讨可改善成功作业驻留时间的调度策略,这类作业通常对用户更具价值。我们的模型假设每个作业具有已知的离散大小分布(例如根据先前执行日志估计),其中最大的大小值表示成功完成,而其他大小值对应终止检查点。在单服务器且所有作业同时可供调度的情况下,我们证明最优调度不抢占作业,即便抢占开销可忽略。基于此,我们开发了在渐近意义上(即作业数量趋于无穷时)最小化成功作业驻留时间的调度策略。通过广泛的数值研究,我们表明即便作业数量有限,该策略也优于现有替代方案。对于具有多服务器与动态作业到达的更现实场景,我们基于单服务器调度策略提出了一种在线方法。通过利用真实世界轨迹的广泛仿真研究,我们证明该在线方法相比于现有技术可得到更优的成功作业平均驻留时间。
引用
@article{arxiv.2205.12891,
title = {Scheduling to Optimize Sojourn Time of Successful Jobs},
author = {Yuan Yao and Marco Paolieri and Leana Golubchik},
journal= {arXiv preprint arXiv:2205.12891},
year = {2022}
}
备注
We found that theorem III.4 is incorrect and we have a different theorem for the performance of the algorithm