中文

从注意力机制到资源 disaggregation:追踪 LLM 推理的演进

分布式、并行与集群计算 2025-11-12 v1

摘要

从 Transformer 架构发展到参数为数千亿的模型,推理阶段已成为大型语言模型的主要瓶颈,而非训练。这一范式转变带来了分布式系统的复杂挑战,受制于内存带宽、计算吞吐和延迟要求。LLM 推理本质上需要解决一个多目标优化问题,以最小化延迟、最大化吞吐量并降低成本。本文探讨了向资源 disaggregation 推理的必要架构转变,这种方法应用分布式系统原则,如服务解耦、资源 disaggregation 和工作负载划分,以克服传统单体 GPU 集群的局限性。通过将计算密集型的 prefill 阶段与内存密集型的 decode 阶段解耦为可独立扩展的组件,这一范式减轻了资源争用,使对关键指标(如 Time to First Token 和 Inter Token Latency)的独立优化成为可能。

关键词

引用

@article{arxiv.2511.07422,
  title  = {From Attention to Disaggregation: Tracing the Evolution of LLM Inference},
  author = {Madabattula Rajesh Kumar and Srinivasa Rao Aravilli and Mustafa Saify and Shashank Srivastava},
  journal= {arXiv preprint arXiv:2511.07422},
  year   = {2025}
}