为何可以舍弃注意力头?探究 BERT 注意力头的迁移机制
计算与语言
2021-06-15 v1
摘要
广泛使用的 BERT 系列模型的巨大规模引发了近期关于模型蒸馏的研究努力。蒸馏的主要目标是创建一个任务无关的预训练模型,该模型可在下游任务上微调而无需对其全尺寸版本进行微调。尽管蒸馏取得了进展,但任务无关模型在多大程度上以及因何原因可通过蒸馏创建尚未得到充分研究。此外,这些 BERT 模型迁移学习背后的机制也未被充分探究。因此,本工作聚焦于分析蒸馏时可接受的删减,以指导未来的蒸馏流程。具体而言,我们首先使用 Michel 等人(2019)提出的注意力头重要性估计,检查 RoBERTa 与 ALBERT 中 Transformer 注意力头的可剪枝性,然后核查预训练任务与下游任务间重要注意力头的一致性。由此,可从结果推导出蒸馏模型时预训练任务上可接受的性能删减,并进一步比较剪枝模型在微调前后的行为。我们的研究为 BERT 系列模型蒸馏的未来方向提供了指导。
引用
@article{arxiv.2106.07137,
title = {Why Can You Lay Off Heads? Investigating How BERT Heads Transfer},
author = {Ting-Rui Chiang and Yun-Nung Chen},
journal= {arXiv preprint arXiv:2106.07137},
year = {2021}
}