中文

schuBERT:优化BERT的架构要素

计算与语言 2020-05-15 v1 机器学习

摘要

Transformer \citep{vaswani2017attention} 已逐渐成为许多最先进自然语言表示模型的关键组件。近期基于Transformer的模型BERT \citep{devlin2018bert} 在包括GLUE、SQuAD v1.1和SQuAD v2.0在内的多种自然语言处理任务上取得了最先进结果。然而该模型计算代价高昂且参数量巨大。本工作中我们重新审视BERT的架构选择,以努力获得更轻量的模型。我们聚焦于减少参数量,但我们的方法也可应用于其他目标如FLOPs或延迟。我们表明,通过算法性地选择并缩减正确的架构设计维度、而非减少Transformer编码器层数,可获得高效得多的轻量BERT模型。具体而言,我们的schuBERT在参数量相同的情况下,相比具有三个编码器层的BERT在GLUE和SQuAD数据集上平均准确率高出 6.6%6.6\%

关键词

引用

@article{arxiv.2005.06628,
  title  = {schuBERT: Optimizing Elements of BERT},
  author = {Ashish Khetan and Zohar Karnin},
  journal= {arXiv preprint arXiv:2005.06628},
  year   = {2020}
}

备注

11 pages, 6 figures, Accepted for publication in ACL 2020 as a long paper