中文

ZettaLith:极端规模 AI 推理加速的架构探索

分布式、并行与集群计算 2025-07-08 v1 人工智能 硬件体系结构 机器学习

摘要

当前及预期的人工智能系统的高计算成本和能源消耗,构成了大规模部署和进一步扩展的主要挑战。现有硬件方法面临基本的效率限制。本文引入 ZettaLith,一种旨在通过超过 1000 倍降低 AI 推理成本和功耗的可扩展计算架构。基于架构分析和技术预测,单台 ZettaLith 机柜可能在 2027 年实现 1.507 赚 FOLPS,从而在推理性能上实现理论上的 1047 倍提升、功率效率提升 1490 倍、相较于当前领先的 GPU 机柜在 FP4 Transformer 推理中可实现 2325 倍更具成本效益。ZettaLith 架构通过摒弃通用 GPU 应用,以及众多协同设计的架构创新所产生的乘数效应,实现了这些收益,详述于本文。ZettaLith 的核心架构原则可高效地向下扩展至 exaFLOPS 级桌面系统和 petaFLOPS 级移动芯片,保持约 1000 倍的优势。ZettaLith 相较于当前 GPU 集群复杂的层次结构,具有更简单的系统架构。ZettaLith 专为 AI 推理优化,不能用于 AI 训练。

关键词

引用

@article{arxiv.2507.02871,
  title  = {ZettaLith: An Architectural Exploration of Extreme-Scale AI Inference Acceleration},
  author = {Kia Silverbrook},
  journal= {arXiv preprint arXiv:2507.02871},
  year   = {2025}
}

备注

53 pages, 15 figures, 23 tables