Mirage:基于强化学习的批处理GPU集群低中断服务研究
分布式、并行与集群计算
2023-06-27 v1
摘要
在使用 Slurm 等传统批处理调度器的 GPU 集群上,容纳长时间运行的深度学习(DL)训练与推理作业颇具挑战。鉴于固定的时钟时间限制,DL 研究人员通常需运行一系列批处理作业,并在过载机器上经历长时间中断。此类中断显著降低了研究生产力以及生产环境中部署服务的服务质量(QoS)。为缓解中断问题,我们研究了一组统计学习与强化学习(RL)技术,包括随机森林、xgboost、Deep Q-Network 与策略梯度,利用来自三个 GPU 集群的生产作业轨迹设计主动供给器。我们遵循标准机器学习实践,将每个作业轨迹划分为训练与验证子集,随后用训练子集训练各模型并用验证子集评估泛化性。我们引入 Mirage,一种兼容 Slurm 且集成了候选 RL 方法的资源供给器。实验表明,Mirage 在三个集群的不同负载水平下可将中断减少 17%–100%,并保障 23%–76% 的作业零中断。
引用
@article{arxiv.2306.14086,
title = {Mirage: Towards Low-interruption Services on Batch GPU Clusters with Reinforcement Learning},
author = {Qiyang Ding and Pengfei Zheng and Shreyas Kudari and Shivaram Venkataraman and Zhao Zhang},
journal= {arXiv preprint arXiv:2306.14086},
year = {2023}
}