ConvBERT:利用基于片段的动态卷积改进 BERT
计算与语言
2021-02-03 v3
摘要
像 BERT 及其变体这样的预训练语言模型近期在各种自然语言理解任务中取得了令人印象深刻的性能。然而,BERT 严重依赖全局自注意力块,因此存在较大的内存占用与计算开销。尽管其所有注意力头都在整个输入序列上查询以从全局视角生成注意力图,我们观察到某些头只需学习局部依赖,这意味着存在计算冗余。因此我们提出一种新颖的基于片段的动态卷积来替换这些自注意力头,以直接建模局部依赖。该新颖卷积头与其余自注意力头一起构成一个新的混合注意力块,在全局与局部上下文学习上均更高效。我们为 BERT 配备此混合注意力设计并构建了 ConvBERT 模型。实验表明,ConvBERT 在各种下游任务中显著优于 BERT 及其变体,且训练成本更低、模型参数更少。值得注意的是,ConvBERTbase 模型取得了 86.4 的 GLUE 分数,比 ELECTRAbase 高 0.7,而训练成本不到其 1/4。代码与预训练模型将公开发布。
引用
@article{arxiv.2008.02496,
title = {ConvBERT: Improving BERT with Span-based Dynamic Convolution},
author = {Zihang Jiang and Weihao Yu and Daquan Zhou and Yunpeng Chen and Jiashi Feng and Shuicheng Yan},
journal= {arXiv preprint arXiv:2008.02496},
year = {2021}
}
备注
17 pages