基于大型语言模型的GPU集群语义感知调度
机器学习
2025-10-07 v1 分布式、并行与集群计算
摘要
深度学习(DL)调度器在优化GPU集群资源分配方面起着关键作用,但存在一个重要局限:它们在管理所管理作业时几乎对语义语境一无所知。这迫使它们依赖有限的元数据,导致高的剖析开销、不可靠的持续时间估计、不充分的故障处理以及差的可观察性。为此,我们提出了SchedMate框架,通过系统性地从被忽视的非结构化数据源(源代码、运行日志和历史作业)中提取深层见解来弥合这一语义鸿沟。SchedMate通过三个基于LLM的组件以非侵入式方式增强现有调度器。我们的实现无缝集成到现有的深度学习调度器中。在128节点物理GPU集群和大量生产轨迹的模拟测试中,SchedMate将平均作业完成时间缩短最高可达1.91倍,显著提升了调度性能,展示了语义感知在现代深度学习调度中的关键作用。
引用
@article{arxiv.2510.03334,
title = {Semantic-Aware Scheduling for GPU Clusters with Large Language Models},
author = {Zerui Wang and Qinghao Hu and Ana Klimovic and Tianwei Zhang and Yonggang Wen and Peng Sun and Dahua Lin},
journal= {arXiv preprint arXiv:2510.03334},
year = {2025}
}