Block-Skim:面向 Transformer 的高效问答方法
计算与语言
2022-05-17 v2
摘要
Transformer 模型在自然语言处理(NLP)任务(包括抽取式问答(QA))上取得了令人瞩目的结果。NLP 任务中常用的 Transformer 编码器在所有层中处理上下文段落所有输入词的隐状态。然而,不同于序列分类等其他任务,回答所提问题未必需要上下文段落中的所有词。基于这一动机,我们提出 Block-Skim,其学习在较高隐层中略过不必要的上下文,以提升并加速 Transformer 的性能。Block-Skim 的核心思想是识别必须进一步处理的上下文以及可在推理早期安全丢弃的上下文。关键的是,我们发现此类信息可充分地从 Transformer 模型内部的自注意力权重中导出。我们进一步在较低层早期剪枝对应不必要位置的隐状态,实现了显著的推理时加速。令我们惊讶的是,我们发现以此方式剪枝的模型优于其完整规模对应模型。Block-Skim 在不同数据集上提升了 QA 模型的准确率,并在 BERT-base 模型上实现了 3 倍加速。
引用
@article{arxiv.2112.08560,
title = {Block-Skim: Efficient Question Answering for Transformer},
author = {Yue Guan and Zhengyi Li and Jingwen Leng and Zhouhan Lin and Minyi Guo and Yuhao Zhu},
journal= {arXiv preprint arXiv:2112.08560},
year = {2022}
}
备注
Published as a conference paper at AAAI 2022