生产 HPC 系统中非破坏性调度转换的运营策略
分布式、并行与集群计算
2026-03-31 v1 性能
摘要
将异构高性能计算 (HPC) 系统迁移到资源感知调度,尤其在具有既定用户工作流程的生产环境中,引入了技术和行为挑战。本文报告了将生产学术 HPC 集群从节点专属调度迁移到可消耗资源调度的案例研究,期间不中断活跃工作负载。我们描述了一种结合有限时间兼容层、基于观测性反馈和针对性用户参与的运营策略,以指导显式资源声明的采用。该方法在转换期间保护了活跃的科研工作流程,避免了直接切换会对用户社区造成的中断。部署后,CPU 工作负载的中位数队列等待时间从 277 分钟降至不到 3 分钟,GPU 工作负载的等待时间从 81 分钟降至 3.4 分钟。采用 TRES-based 提交方式的用户表现出强烈的长期留存率。这些结果表明,成功的调度转换不仅取决于系统配置,还取决于将观测性、用户参与和运营设计相结合。
引用
@article{arxiv.2603.27863,
title = {Operational Strategies for Non-Disruptive Scheduling Transitions in Production HPC Systems},
author = {Glen MacLachlan and Joseph Creech and Rubeel Muhammad Iqbal and Clark Gaylord and Jake Messick},
journal= {arXiv preprint arXiv:2603.27863},
year = {2026}
}
备注
4 pages, 3 figures, 1 table, submitted to PEARC'26