细分化还能达到什么高度?注意力-FFN 细分在高效 MoE 大语言模型推理中的设计空间探索
机器学习
2026-05-28 v1 人工智能
分布式、并行与集群计算
摘要
现代大型语言模型 (LLM) 推理正逐步采用细分化策略,以适应模型规模的不断增长以及紧张的 TTFT 和 TPOT 服务水平目标:从分块预填聚合,到预填-解码 (P/D) 细分,以及最近的注意力-FFN 细分 (AFD)。这一趋势在混合专家 (MoE) 模型中尤为重要,因为注意力计算受内存限制、专家 FFN 计算密集、以及 MoE 分配/合并通信产生不同的资源需求。AFD 通过将注意力和 MoE-FFN 执行置于独立的 GPU 组中,进一步暴露了这种异构性。每一级细分化都深化了跨工作负载特征、资源分配和互连�拓扑的调度设计空间,提出核心问题:每一级细分化实际上何时才值得实现?我们系统性地描绘了 MoE 推理在真实工作负载下的这种权衡——这些工作负载涵盖输入/输出序列长度、前缀 KV 重用以及每个用户的延迟约束。以分块预填和 P/D 细分化为基准,我们通过一个融合设备内核测量与高保真网络仿真的框架,研究了 AFD 在规模化部署中的收益与限制。在严格的 TTFT/TPOT SLO 条件下,AFD 在 DeepSeek-V3.2 上可维持约 4k tokens/s 的系统吞吐量,适用于聊天、编码和 agentic-coding 工作负载,而非 AFD 部署在此场景下不可行。我们提炼出具体的经验法则,用于在吞吐量和交互性之间进行联合优化,包括如何根据工作负载和模型架构将注意力和 FFN 分配到 GPU 上,为当前机架级和集群级部署以及未来细分化 AI 基础设施提供设计原则。
引用
@article{arxiv.2605.28302,
title = {How Far Can Disaggregation Go? A Design-Space Exploration of Attention-FFN Disaggregation for Efficient MoE LLM Serving},
author = {Hanjiang Wu and Abhimanyu Rajeshkumar Bambhaniya and Sarbartha Banerjee and Tuhin Khare and Sudarshan Srinivasan and Suvinay Subramanian and Souvik Kundu and Madhu Kumar and Midhilesh Elavazhagan and William Won and Amir Yazdanbakhsh and Tushar Krishna},
journal= {arXiv preprint arXiv:2605.28302},
year = {2026}
}