中文

Transformer推理的全栈优化:一篇综述

计算与语言 2023-08-23 v1 机器学习

摘要

近期最先进DNN架构设计的进展已转向Transformer模型。这些模型在广泛应用上取得了优越精度。自Transformer模型被首次提出以来,这一趋势在过去数年中持续不变。然而,近期Transformer模型推理所需的计算量与带宽正以显著速率增长,这使其在对延迟敏感应用中的部署颇具挑战。因此,人们愈发关注提升Transformer模型的效率,方法涵盖从改变架构设计,到开发专用的领域特定加速器。本工作中,我们综述了高效Transformer推理的不同方法,包括:(i) 对现有Transformer架构瓶颈的分析与剖析,及其与先前卷积模型的异同;(ii) Transformer架构对硬件的影响,包括Layer Normalization、Softmax和GELU等非线性和线性运算对硬件设计的影响;(iii) 优化固定Transformer架构的方法;(iv) 为Transformer模型寻找正确运算映射与调度所面临的挑战;(v) 通过神经架构搜索调整架构来优化Transformer模型的方法。最后,我们在开源全栈DNN加速器生成器Gemmini上应用所综述的优化进行案例研究,并展示相较于Gemmini上先前的基准结果,每种方法如何带来改进。除其他发现外,我们发现采用上述方法的全栈协同设计方法可为Transformer推理带来高达88.7倍的加速,且性能退化极小。

关键词

引用

@article{arxiv.2302.14017,
  title  = {Full Stack Optimization of Transformer Inference: a Survey},
  author = {Sehoon Kim and Coleman Hooper and Thanakul Wattanawong and Minwoo Kang and Ruohan Yan and Hasan Genc and Grace Dinh and Qijing Huang and Kurt Keutzer and Michael W. Mahoney and Yakun Sophia Shao and Amir Gholami},
  journal= {arXiv preprint arXiv:2302.14017},
  year   = {2023}
}