中文

计算无法处理真理:为何通信税在现代 AI 基础设施中优先考虑内存和互联

分布式、并行与集群计算 2025-07-15 v2 硬件体系结构

摘要

现代 AI 工作负载(如大语言模型LLMs和检索增强生成RAG)对内存、通信带宽和资源灵活性提出了严苛要求。传统的 GPU 中心架构由于日益增长的 GPU 间通信开销,难以实现规模化。本报告介绍关键 AI 概念,阐述Transformer如何彻底改变LLMs的数据表示方式。我们分析了大规模 AI 硬件和数据中心设计,识别出层次化系统中的可扩展性瓶颈。为解决这些问题,我们提出一种基于Compute Express Link(CXL)的模块化数据中心架构,以实现内存、计算和加速器的解耦式扩展。我们进一步探讨了针对加速器优化的互联技术——总称为XLink(如UALink、NVLink、NVLink Fusion)——并引入一种混合CXL-over-XLink设计,以减少远程数据传输,同时保持内存一致性。我们还提出一种层次化内存模型,将局部内存和池化内存相结合,并评估了轻量级CXL实现、HBM和硅光子技术,以实现高效扩展。我们的评估表明,在 AI 基础设施方面,本方案在可扩展性、吞吐量和灵活性方面均取得改进。

关键词

引用

@article{arxiv.2507.07223,
  title  = {Compute Can't Handle the Truth: Why Communication Tax Prioritizes Memory and Interconnects in Modern AI Infrastructure},
  author = {Myoungsoo Jung},
  journal= {arXiv preprint arXiv:2507.07223},
  year   = {2025}
}