中文

SDBERT:SparseDistilBERT,一种更快更小的 BERT 模型

计算与语言 2022-08-23 v1 信息论 机器学习 math.IT

摘要

本工作中我们提出一种称为 SparseDistilBERT(SDBERT)的新 Transformer 架构,它结合了稀疏注意力与知识蒸馏(KD)。我们实现了稀疏注意力机制,将关于输入长度的二次依赖降为线性。除降低模型计算复杂度外,我们使用了知识蒸馏(KD)。我们能够将 BERT 模型尺寸缩减 60%,同时保留 97% 的性能,且训练仅耗时 40%。

关键词

引用

@article{arxiv.2208.10246,
  title  = {SDBERT: SparseDistilBERT, a faster and smaller BERT model},
  author = {Devaraju Vinoda and Pawan Kumar Yadav},
  journal= {arXiv preprint arXiv:2208.10246},
  year   = {2022}
}