中文

WATOS:面面板芯片的高效 LLM 训练策略与架构共探索

信号处理 2025-12-16 v1

摘要

训练大型语言模型 (LLM) 对计算、存储容量和互连带宽提出了极端要求,这些要求源于参数规模不断增大以及数据传输的强烈需求。晶圆级集成通过密集集成多个单芯片并提供高速芯片间互连 (D2D) 来提供可能的解决方案。然而,受限于晶圆面积,必须在计算、存储和通信资源之间进行权衡。充分发挥晶圆级集成的潜力,同时缓解其架构约束,对于最大化 LLM 训练性能至关重要。这对架构与训练策略的共优化提出了重大挑战。不幸的是,现有的做法在解决这些挑战方面均不足。为弥合这一差距,我们提出 WATOS,一个用于 LLM 训练策略和晶圆级架构的共探索框架。我们首先定义一个高度可配置的硬件模板,用于探索晶圆级芯片的最佳架构参数。基于此,我们利用晶圆级芯片固有的高 D2D 带宽和细粒度操作优势,探索最佳并行度和资源分配策略,有效解决 LLM 训练期间存储 underutilization 的问题。相较于最先进的 (SOTA) LLM 训练框架 Megatron 和 Cerebrus 的重量流式晶圆训练策略,WATOS 在各种 LLM 模型上分别可实现平均整体吞吐量提升 2.74 倍和 1.53 倍。此外,我们利用 WATOS 揭示了在 LLM 工作负载训练中关于晶圆级架构设计的有趣见解。

关键词

引用

@article{arxiv.2512.12279,
  title  = {WATOS: Efficient LLM Training Strategies and Architecture Co-exploration for Wafer-scale Chip},
  author = {Huizheng Wang and Zichuan Wang and Hongbin Wang and Jingxiang Hou and Taiquan Wei and Chao Li and Yang Hu and Shouyi Yin},
  journal= {arXiv preprint arXiv:2512.12279},
  year   = {2025}
}

备注

Accepted by HPCA 2026