中文

EnergonAI:面向 10–100 亿参数 Transformer 模型的推理系统

机器学习 2022-09-07 v1 分布式、并行与集群计算

摘要

大型 transformer 模型在广泛的自然语言处理(NLP)任务上展现出良好性能。尽管 AI 界已将模型规模扩展至万亿参数级别,但由于延迟、吞吐量与内存限制,10–100 亿参数模型的实际部署仍不确定。本文中,我们提出 EnergonAI 以解决 10–100 亿参数 transformer 模型在单 GPU 或多 GPU 系统上高效部署的挑战。EnergonAI 采用层级控制器系统架构来协调多设备并高效支持不同并行模式。它以单控制器风格将子模型执行委派给多个 worker,并以多控制器风格在 worker 间应用张量并行与流水线并行。基于该新颖架构,我们提出三项技术:非阻塞流水线并行、分布式冗余计算消除与对等内存池。EnergonAI 使用户能以编写串行代码般的方式编写复杂并行代码。相较 FasterTransformer,我们证明了 EnergonAI 在延迟与吞吐量上具更优性能。实验中,EnergonAI 在张量并行上实现 37% 延迟降低,在流水线并行上实现 10% 可扩展性提升,并通过使用更大异构内存空间以有限性能下降为代价提升了单 GPU 上可推理的模型规模。

关键词

引用

@article{arxiv.2209.02341,
  title  = {EnergonAI: An Inference System for 10-100 Billion Parameter Transformer Models},
  author = {Jiangsu Du and Ziming Liu and Jiarui Fang and Shenggui Li and Yongbin Li and Yutong Lu and Yang You},
  journal= {arXiv preprint arXiv:2209.02341},
  year   = {2022}
}