LV-BERT:利用层多样性改进 BERT
计算与语言
2021-06-28 v2 人工智能
机器学习
摘要
现代预训练语言模型大多建立在以交错顺序堆叠自注意力与前馈层的骨干网络之上。本文超越这种刻板化的层模式,旨在从层类型集合与层顺序两方面利用层多样性来改进预训练模型。具体而言,除原有的自注意力层与前馈层外,我们将卷积引入层类型集合,实验发现其有益于预训练模型。此外,超越原有的交错顺序,我们探索了更多层顺序以发现更强大的架构。然而,引入的层多样性导致了超过数十亿候选者的巨大架构空间,而从头训练单个候选模型已需巨大计算成本,使得直接训练大量候选模型来搜索该空间难以承受。为解决此问题,我们首先预训练一个超网,所有候选模型的权重均可从中继承,然后采用由预训练精度引导的进化算法寻找最优架构。大量实验表明,由我们的方法得到的 LV-BERT 模型在各种下游任务上优于 BERT 及其变体。例如,LV-BERT-small 在 GLUE 测试集上取得 79.8,比强基线 ELECTRA-small 高 1.8。
引用
@article{arxiv.2106.11740,
title = {LV-BERT: Exploiting Layer Variety for BERT},
author = {Weihao Yu and Zihang Jiang and Fei Chen and Qibin Hou and Jiashi Feng},
journal= {arXiv preprint arXiv:2106.11740},
year = {2021}
}
备注
Accepted to Findings of ACL 2021. The code and pre-trained models are available at https://github.com/yuweihao/LV-BERT