数据中心网络可扩展的流级尾延迟估计
网络与互联网体系结构
2022-10-03 v2
摘要
在本文中,我们研究如何为超大规模数据中心网络提供流级尾延迟性能的快速估计。网络尾延迟通常是云应用性能的关键指标,会受到多种因素影响,包括网络负载、机架间流量倾斜、流量突发性、流大小分布、超额订阅以及拓扑不对称。ns-3 和 OMNeT++ 等网络模拟器能提供准确结果,但极难并行化,即便在中等规模下,针对单一配置回答“假设”问题也需数小时乃至数天。近期 MimicNet 相关工作展示了如何利用机器学习提升模拟性能,但代价是为每个配置加入漫长的训练步骤,且对负载与拓扑均匀性做出了实践中通常不成立的前提假设。我们填补这一空白,提出一系列技术,为具有通用流量矩阵与拓扑的大规模网络提供快速性能估计。关键一步是将问题分解为大量并行的独立单链路模拟;我们细致地组合这些链路级模拟,以生成整个网络端到端流级性能分布的准确估计。与 MimicNet 类似,我们在可能时利用对称性获取额外加速,但不依赖机器学习,因此不存在训练延迟。在 ns-3 需 11 至 27 小时来模拟 5 秒网络行为的大规模网络上,我们的技术在 1 至 2 分钟内运行完毕,对流完成时间的 99 分位精度在 9% 以内。
引用
@article{arxiv.2205.01234,
title = {Scalable Tail Latency Estimation for Data Center Networks},
author = {Kevin Zhao and Prateesh Goyal and Mohammad Alizadeh and Thomas E. Anderson},
journal= {arXiv preprint arXiv:2205.01234},
year = {2022}
}