AdapLeR:通过自适应长度缩减加速推理
计算与语言
2022-03-18 v1
摘要
预训练语言模型在各种下游任务中表现出了卓越的性能。但这通常以高延迟和高计算量为代价,阻碍其在资源受限环境中的应用。在本工作中,我们提出一种新方法,以最小的下游性能损失降低 BERT 的计算成本。我们的方法通过各层动态消除贡献较小的 token,从而得到更短的长度并降低计算成本。为确定每个 token 表示的重要性,我们使用基于梯度的显著性方法为每一层训练一个贡献预测器(Contribution Predictor)。我们在多个不同的分类任务上的实验表明,推理时间最高可加速 22 倍,而性能牺牲不大。我们还使用 ERASER 基准中的人工标注验证了本方法所选 token 的质量。与显著性(saliency)和注意力(attention)等其他广泛使用的选择重要 token 的策略相比,我们提出的方法在生成解释理由时具有显著更低的假阳性率。我们的代码已在 https://github.com/amodaresi/AdapLeR 免费提供。
引用
@article{arxiv.2203.08991,
title = {AdapLeR: Speeding up Inference by Adaptive Length Reduction},
author = {Ali Modarressi and Hosein Mohebbi and Mohammad Taher Pilehvar},
journal= {arXiv preprint arXiv:2203.08991},
year = {2022}
}
备注
Accepted to ACL 2022 (main conference)