SDBERT:SparseDistilBERT,一种更快更小的 BERT 模型
计算与语言
2022-08-23 v1 信息论
机器学习
math.IT
摘要
本工作中我们提出一种称为 SparseDistilBERT(SDBERT)的新 Transformer 架构,它结合了稀疏注意力与知识蒸馏(KD)。我们实现了稀疏注意力机制,将关于输入长度的二次依赖降为线性。除降低模型计算复杂度外,我们使用了知识蒸馏(KD)。我们能够将 BERT 模型尺寸缩减 60%,同时保留 97% 的性能,且训练仅耗时 40%。
关键词
引用
@article{arxiv.2208.10246,
title = {SDBERT: SparseDistilBERT, a faster and smaller BERT model},
author = {Devaraju Vinoda and Pawan Kumar Yadav},
journal= {arXiv preprint arXiv:2208.10246},
year = {2022}
}