Magic Pyramid:利用早退与词元剪枝加速推理
计算与语言
2021-11-02 v1
摘要
预训练然后微调大语言模型(LLM)是获取自然语言处理(NLP)任务最先进性能的常用方法。然而,大多数预训练模型存在推理速度低的问题。将此类大型模型部署到具有延迟约束的应用中具有挑战性。在本工作中,我们专注于通过条件计算加速推理。为此,我们提出一种新颖思路 Magic Pyramid(MP),通过针对基于 Transformer 的模型(特别是 BERT)进行词元剪枝与早退,从而减少宽度方向与深度方向的计算。前者通过移除非显著词元来节省计算,后者可在满足退出条件时于到达最终层之前提前终止推理以实现计算缩减。我们的实证研究表明,与先前最先进方法相比,MP 不仅能够实现速度可调的推理,还能以低于 0.5% 的精度下降减少多达 70% 的十亿浮点运算(GFLOPs),从而超越词元剪枝与早退。词元剪枝与早退对具有不同长度的序列表现出不同偏好。然而,MP 能够在两个流行的文本分类任务上实现平均 8.06 倍的加速,且与输入大小无关。
引用
@article{arxiv.2111.00230,
title = {Magic Pyramid: Accelerating Inference with Early Exiting and Token Pruning},
author = {Xuanli He and Iman Keivanloo and Yi Xu and Xiang He and Belinda Zeng and Santosh Rajagopalan and Trishul Chilimbi},
journal= {arXiv preprint arXiv:2111.00230},
year = {2021}
}
备注
8 pages