SuperBench:通过主动验证提升云 AI 基础设施可靠性
分布式、并行与集群计算
2024-06-11 v2
摘要
云 AI 基础设施的可靠性对云服务提供商至关重要,这促使了硬件冗余的广泛使用。然而,这些冗余可能会无意中导致 AI 工作负载的隐性退化,即所谓的“灰度故障”,严重影响端到端性能并掩盖性能问题,从而使故障和回归的根因分析复杂化。我们引入了 SuperBench,这是一个针对 AI 基础设施的主动验证系统,旨在缓解由硬件冗余引起的隐性退化并提升整体可靠性。SuperBench 具有全面的基准测试套件,能够评估各个硬件组件并代表大多数真实的 AI 工作负载。它包含一个 Validator,用于学习基准测试标准以精确定位缺陷组件。此外,SuperBench 还集成了一个 Selector,以平衡验证时间与问题相关的惩罚,从而利用定制的基准测试子集实现验证执行的最佳时机。通过测试床评估和模拟,我们证明 SuperBench 可以将事件间的平均时间增加高达 22.61 倍。SuperBench 已成功部署在 Azure 生产环境中,在过去两年中验证了数十万个 GPU。
引用
@article{arxiv.2402.06194,
title = {SuperBench: Improving Cloud AI Infrastructure Reliability with Proactive Validation},
author = {Yifan Xiong and Yuting Jiang and Ziyue Yang and Lei Qu and Guoshuai Zhao and Shuguang Liu and Dong Zhong and Boris Pinzur and Jie Zhang and Yang Wang and Jithin Jose and Hossein Pourreza and Jeff Baxter and Kushal Datta and Prabhat Ram and Luke Melton and Joe Chau and Peng Cheng and Yongqiang Xiong and Lidong Zhou},
journal= {arXiv preprint arXiv:2402.06194},
year = {2024}
}
备注
USENIX ATC '24