schuBERT:优化BERT的架构要素
计算与语言
2020-05-15 v1 机器学习
摘要
Transformer \citep{vaswani2017attention} 已逐渐成为许多最先进自然语言表示模型的关键组件。近期基于Transformer的模型BERT \citep{devlin2018bert} 在包括GLUE、SQuAD v1.1和SQuAD v2.0在内的多种自然语言处理任务上取得了最先进结果。然而该模型计算代价高昂且参数量巨大。本工作中我们重新审视BERT的架构选择,以努力获得更轻量的模型。我们聚焦于减少参数量,但我们的方法也可应用于其他目标如FLOPs或延迟。我们表明,通过算法性地选择并缩减正确的架构设计维度、而非减少Transformer编码器层数,可获得高效得多的轻量BERT模型。具体而言,我们的schuBERT在参数量相同的情况下,相比具有三个编码器层的BERT在GLUE和SQuAD数据集上平均准确率高出 。
引用
@article{arxiv.2005.06628,
title = {schuBERT: Optimizing Elements of BERT},
author = {Ashish Khetan and Zohar Karnin},
journal= {arXiv preprint arXiv:2005.06628},
year = {2020}
}
备注
11 pages, 6 figures, Accepted for publication in ACL 2020 as a long paper