中文

揭示注意力-FFN 解聚对现代混合专家模型及硬件系统的挑战

分布式、并行与集群计算 2026-02-11 v1

摘要

部署大规模混合专家(MoE)模型在专家激活方面面临存储容量和带宽挑战。虽然注意力-FFN 解聚(Attention-FFN Disaggregation, AFD)已然成为一种潜在架构,用于解耦计算和内存资源,但其性能边界相较于标准大规模专家并行(Expert Parallelism, EP)仍鲜有探讨。本文通过将屋顶模型扩展至通信层,系统性地分析了 AFD,将互连带宽、算术强度和硬件 FLOPS 利用率(Hardware FLOPS Utilization, HFU)相关联。我们的分析揭示了标准集群上的死区:增加 FFN 实例数量未能提升 HFU,因为计算负载受规模化带宽限制,导致算子活跃时间相对于固定延迟预算缩小。我们进一步表明,AFD 的离散节点级扩展比 EP 的连续批次调整更高效。不过,这些局限性在特定条件下会消退:超级机房级硬件拥有丰富的互连带宽,同时模型具有粗粒度专家和较低稀疏性时,更有利于 AFD 的实际应用。这些发现将 AFD 定位为针对特定硬件-模型组合的有前景的方法,而非通用解决方案。

关键词

引用

@article{arxiv.2602.09721,
  title  = {Revealing the Challenges of Attention-FFN Disaggregation for Modern MoE Models and Hardware Systems},
  author = {Guowei Liu and Hongming Li and Yaning Guo and Yongxi Lyu and Mo Zhou and Yi Liu and Zhaogeng Li and Yanpeng Wang},
  journal= {arXiv preprint arXiv:2602.09721},
  year   = {2026}
}