数据中心中的幽灵:链路飘移、拓扑知识失效与FITO范式误分类
摘要
数据中心中的每一次链路断开或飘移都会损坏网络的自我知识——其图。我们将这种损坏称为幽灵:一种看似可达但实际不可达的节点、一条报告为"up"但静默丢弃流量的链路,或一个解析到已分区机器的 IP 地址。幽灵在每个尺度上都出现——从芯片到芯片(Pcie、UciE)、GPU到 GPU(NvLink、NvSwitch)、节点到节点(Ethernet、Thunderbolt)到集群到集群(IP、Bgp),因为所有这些协议都继承了香浅的前向时序-only(FITO)信道模型,并使用超时与重试(TAR)作为其故障检测器。TAR无法区分"慢"与"死",这正是费舍尔-林奇-帕特森在异步系统中证明不可分辨的歧义。我们使用来自 Meta(54天内419次中断)、ByteDance(三个月内38236次显式和5948次隐式故障)、Google(TPUv4 光路交换)和阿里巴巴(每月0.057% NIC-ToR 链路故障)的生产数据进行调查。在2025年集群规模(约300万 GPU,超过1000万光链路)下,链路飘移每48秒发生一次。我们指出,现有的每一种缓解措施——包括 Phi Accrual 故障检测器、Swim、Bfd、Ospf/IsIs 快速收敛、SmartNIC 卸载、无损以太网(Roce/Pfc)以及 Kubernetes pod 驱逐——仍会产生幽灵,因为每一种方法都本质上是基于超时的。我们将幽灵与灰色故障(Huang 等人,HotOS 2017)和亚稳态故障(Bronson 等人,HotOS 2021;在11个组织中验证了22次故障,OsDi 2022)相联系。我们认为,Open Atomic Ethernet 通过可靠链路故障检测器、完美信息反馈、三角故障转移以及原子令牌传输,消除了链路层的幽灵,从而使拓扑知识具有事务性。
引用
@article{arxiv.2603.03736,
title = {The Ghost in the Datacenter: Link Flapping, Topology Knowledge Failures, and the FITO Category Mistake},
author = {Paul Borrill},
journal= {arXiv preprint arXiv:2603.03736},
year = {2026}
}