Metronome:面向网络与优先级感知的周期性流量作业高效调度机制
分布式、并行与集群计算
2026-02-11 v2
摘要
随着计算需求的快速增长,云原生网络已成为解决高效资源协调问题的热门方案,尤其是在集群中应对网络带宽动态波动方面。我们提出了 Metronome,一种面向云原生网络的网络感知与优先级感知调度机制。该机制旨在支持具有周期性流量模式和动态带宽需求的作业,特别是在分布式训练场景中。具体而言,Metronome 采用时分复用方法,利用作业的流量特征构建弹性网络资源分配模型,实现跨多个作业的高效带宽共享。此外,它融入多目标优化策略,联合考虑延迟与作业优先级,以实现全局最优及动态资源分配。最后,Metronome 通过监控集群状态并执行重新配置操作来适应动态环境。广泛的 13 项常用机器学习模型实验表明,Metronome 在保证服务性能的前提下,可提升集群资源利用率。与现有 Kubernetes 调度机制相比,在多种场景下,Metronome 可将作业完成时间缩短最高 19.50%,同时将平均带宽利用率提升最高 23.20%。
引用
@article{arxiv.2510.12274,
title = {Metronome: Efficient Scheduling for Periodic Traffic Jobs with Network and Priority Awareness},
author = {Hao Jiang and Meng Qin and Ruijie Kuai and Dandan Liang and Yue Gao},
journal= {arXiv preprint arXiv:2510.12274},
year = {2026}
}
备注
17 pages, 16 figures. This work has been submitted to the IEEE for possible publication