中文

Easy and Efficient Transformer:面向大型NLP模型的可扩展推理方案

计算与语言 2022-05-25 v5

摘要

近年来,基于大规模transformer的模型已被证明在多个领域的各类任务上均有效。然而,将其应用于工业生产的繁重工作以减少推理成本。为弥补这一差距,我们引入了一种可扩展推理方案:Easy and Efficient Transformer(EET),包含在算法与实现层面对transformer推理的一系列优化。首先,我们针对长输入与大隐藏维度设计了高度优化的核函数。其次,我们提出了一种灵活的CUDA内存管理器,以在部署大型模型时降低内存占用。相较于最先进的transformer推理库(Faster Transformer v4.0),EET在A100 GPU上对transformer解码器层可实现平均1.40-4.20倍的加速。

关键词

引用

@article{arxiv.2104.12470,
  title  = {Easy and Efficient Transformer : Scalable Inference Solution For large NLP model},
  author = {Gongzheng Li and Yadong Xi and Jingzhen Ding and Duan Wang and Bai Liu and Changjie Fan and Xiaoxi Mao and Zeng Zhao},
  journal= {arXiv preprint arXiv:2104.12470},
  year   = {2022}
}