Transkimmer:Transformer 学习逐层略读
计算与语言
2022-05-17 v1
摘要
Transformer 架构已成为自然语言处理和计算机视觉中许多机器学习任务的事实标准模型。因此,提高其计算效率变得至关重要。基于 Transformer 的模型的主要计算低效之一在于它们在所有层中耗费相同的计算量。先前的工作提出为 Transformer 模型增加略读 token 的能力以提高其计算效率。然而,它们受限于缺乏对离散略读预测器的有效且端到端的优化。为解决上述局限,我们提出 Transkimmer 架构,其学习识别各层不需要的隐藏状态 token。被略读的 token 随后直接转发至最终输出,从而减少后续层的计算。Transkimmer 的核心思想是在每层之前添加一个参数化预测器,学习做出略读决策。我们还提出采用重参数化技巧并添加略读损失以实现 Transkimmer 的端到端训练。与原始 BERT-base 基线相比,Transkimmer 在 GLUE 基准上实现了 10.97 倍的平均加速,且精度下降小于 1%。
引用
@article{arxiv.2205.07324,
title = {Transkimmer: Transformer Learns to Layer-wise Skim},
author = {Yue Guan and Zhengyi Li and Jingwen Leng and Zhouhan Lin and Minyi Guo},
journal= {arXiv preprint arXiv:2205.07324},
year = {2022}
}
备注
Published as a conference paper at ACL 2022