IceFormer:在 CPU 上加速的长序列 Transformer
机器学习
2024-05-07 v1
摘要
现有基于 Transformer 的模型的一个局限是无法处理非常长的序列输入,因为其自注意力运算 exhibits 二次时间和空间复杂度。这一问题在 Transformer 部署仅具备 CPU 硬件平台时尤为突出。为解决此问题,我们提出一种在推理阶段加速自注意力的方法,可与预训练的 Transformer 模型即插即用,无需重新训练。我们使用该方法对 various long-sequence Transformers 进行实验,包括领先的基于 LLaMA 2 的大型语言模型,在 various benchmarks 上实现 2.73 倍至 7.63 倍的加速,同时保持原始预训练模型 98.6% 至 99.6% 的准确率。该代码已在我们的项目网站 https://yuzhenmao.github.io/IceFormer/ 上提供。
关键词
引用
@article{arxiv.2405.02842,
title = {IceFormer: Accelerated Inference with Long-Sequence Transformers on CPUs},
author = {Yuzhen Mao and Martin Ester and Ke Li},
journal= {arXiv preprint arXiv:2405.02842},
year = {2024}
}