中文

T3:面向计算与集合通信细粒度重叠的透明追踪与触发机制

硬件体系结构 2024-01-31 v1 分布式、并行与集群计算 机器学习

摘要

大型语言模型越来越依赖分布式技术进行训练和推理。这些技术需要跨设备通信,随着设备数量的增加,这可能会降低扩展效率。虽然一些分布式技术可以重叠,从而将这些通信与独立计算隐藏起来,但诸如张量并行(TP)之类的技术本质上将通信与模型执行串行化。隐藏这种串行化通信的一种方法是以细粒度的方式将其与(所通信数据的)生产者操作交错执行。然而,在软件中实现这种通信与计算的细粒度交错可能很困难。此外,与任何并发执行一样,它需要计算和内存资源在计算与通信之间共享,从而导致资源争用,降低重叠效率。为了克服这些挑战,我们提出了T3,它应用软硬件协同设计来透明地重叠串行化通信,同时最小化与计算的资源争用。T3通过对生产者输出地址空间的简单配置,透明地将生产者操作与后续通信融合,并且只需要少量的软件更改。在硬件层面,T3增加了一个轻量级的追踪和触发机制来协调生产者的计算和通信。它进一步利用计算增强型内存来处理通信附带的计算。因此,T3减少了资源争用,并高效地将串行化通信与计算重叠。对于像T-NLG这样的重要Transformer模型,T3将通信密集型子层的速度提高了30%(几何平均值,最高47%),并将数据移动减少了22%(几何平均值,最大36%)。此外,T3的收益随着模型规模的扩大而持续存在:对于参数规模约5000亿的模型PALM和MT-NLG中的子层,几何平均加速为29%。

关键词

引用

@article{arxiv.2401.16677,
  title  = {T3: Transparent Tracking & Triggering for Fine-grained Overlap of Compute & Collectives},
  author = {Suchita Pati and Shaizeen Aga and Mahzabeen Islam and Nuwan Jayasena and Matthew D. Sinclair},
  journal= {arXiv preprint arXiv:2401.16677},
  year   = {2024}
}

备注

To appear at the International Conference on Architectural Support for Programming Languages and Operating Systems (ASPLOS) 2024