Easy and Efficient Transformer:面向大型NLP模型的可扩展推理方案
计算与语言
2022-05-25 v5
摘要
近年来,基于大规模transformer的模型已被证明在多个领域的各类任务上均有效。然而,将其应用于工业生产的繁重工作以减少推理成本。为弥补这一差距,我们引入了一种可扩展推理方案:Easy and Efficient Transformer(EET),包含在算法与实现层面对transformer推理的一系列优化。首先,我们针对长输入与大隐藏维度设计了高度优化的核函数。其次,我们提出了一种灵活的CUDA内存管理器,以在部署大型模型时降低内存占用。相较于最先进的transformer推理库(Faster Transformer v4.0),EET在A100 GPU上对transformer解码器层可实现平均1.40-4.20倍的加速。
引用
@article{arxiv.2104.12470,
title = {Easy and Efficient Transformer : Scalable Inference Solution For large NLP model},
author = {Gongzheng Li and Yadong Xi and Jingzhen Ding and Duan Wang and Bai Liu and Changjie Fan and Xiaoxi Mao and Zeng Zhao},
journal= {arXiv preprint arXiv:2104.12470},
year = {2022}
}