Topkima-Former:使用 top-k 存内 ADC 的低能耗低延迟 Transformer 推理
硬件体系结构
2024-11-21 v1
摘要
Transformer 模型作为自然语言处理(NLP)和计算机视觉(CV)应用中流行的深度神经网络架构而备受瞩目。然而,非线性操作(如 softmax)的广泛使用在 Transformer 推理过程中构成了性能瓶颈,最高可占总延迟的 40%。因此,我们提出了在电路、架构和算法层面的创新以加速 Transformer。在电路层面,我们提出了 topkima——将 top-k 激活选择与存内 ADC(IMA)相结合,以实现无任何排序延迟的低能耗、低延迟 softmax。仅将最大的 k 个激活值发送至 softmax 计算块,从而大幅降低 softmax 的巨大计算开销。采用仅在正向传播中使用 top-k 的改进训练方案,实验结果表明,在 k=5 时,ViT、distilBERT 和 BERT-base 模型在 CIFAR-10、CIFAR-100 和 SQuAD 数据集上的准确率仅下降 0.4% 至 1.2%。在架构层面,引入了一种改进的无缩放技术以降低注意力的计算开销。组合系统被称为 Topkima-Former,与以往的存内计算(IMC)加速器相比,实现了 1.8 倍至 84 倍的加速和 1.3 倍至 35 倍的能效(EE)提升。与传统的 softmax 宏和数字 top-k(Dtopk)softmax 宏相比,我们提出的 tokima softmax 宏分别实现了约 15 倍和 8 倍的速度提升。
引用
@article{arxiv.2411.13050,
title = {Topkima-Former: Low-energy, Low-Latency Inference for Transformers using top-k In-memory ADC},
author = {Shuai Dong and Junyi Yang and Xiaoqi Peng and Hongyang Shang and Ye Ke and Xiaofeng Yang and Hongjie Liu and Arindam Basu},
journal= {arXiv preprint arXiv:2411.13050},
year = {2024}
}
备注
7 pages