基于 T10 的深度学习计算在核内互联智能处理器上的扩展
分布式、并行与集群计算
2024-09-25 v2 机器学习
摘要
随着 AI 芯片采用大量并行核心来扩展深度学习(DL)计算,近期通过在芯片上采用高带宽低延迟互联链路(如 Graphcore IPU)实现了核心间通信。这使得每个核心能够直接访问其他核心的快速 scratchpad 存储,从而实现新的并行计算范式。然而,由于当前 DL 编译器缺乏对可扩展核间连接的支持,开发人员难以利用这一新架构的优势。我们提出了 T10,这是第一个利用核间通信带宽和分布式片上内存的 DL 编译器。为此,T10 引入了分布式张量抽象 rTensor。T10 将 DNN 模型映射到具有通用计算-位移模式的执行计划,通过将 DNN 计算划分为子运算符并将其映射到核心,以便核心遵循可预测的模式进行数据交换。T10 在片上内存消耗和核间通信开销之间进行全局优化,从优化空间中选择最佳执行计划,并减轻不必要的核间通信。我们在真实的核间互联 AI 芯片(Graphcore IPU)上进行评估,显示相较于最先进的 DL 编译器和供应商库,性能提升最高可达 3.3 倍,并支持更大模型的扩展。
关键词
引用
@article{arxiv.2408.04808,
title = {Scaling Deep Learning Computation over the Inter-Core Connected Intelligence Processor with T10},
author = {Yiqi Liu and Yuqi Xue and Yu Cheng and Lingxiao Ma and Ziming Miao and Jilong Xue and Jian Huang},
journal= {arXiv preprint arXiv:2408.04808},
year = {2024}
}
备注
This paper is accepted at The 30th ACM Symposium on Operating Systems Principles (SOSP'24)