AutoBERT-Zero:从零进化BERT骨干网络
计算与语言
2022-02-08 v2 机器学习
摘要
基于Transformer的预训练语言模型(如BERT及其变体)近期在各种自然语言处理(NLP)任务中取得了令人瞩目的性能。然而,传统范式通过纯粹堆叠人工设计的全局自注意力层来构建骨干网络,引入了归纳偏置从而导致次优。在本工作中,我们首次尝试在一个包含最基础操作的灵活搜索空间中从零自动发现新颖的预训练语言模型(PLM)骨干网络。具体而言,我们提出一个精心设计的搜索空间,其(i)在层内层面包含原始数学操作以探索新颖注意力结构,(ii)在层间层面利用卷积块作为注意力的补充以更好地学习局部依赖。为提升寻找有前景架构的效率,我们提出操作优先级神经架构搜索(OP-NAS)算法,该算法同时优化搜索算法与候选模型评估。具体地,我们提出操作优先级(OP)进化策略,通过平衡探索与利用来促进模型搜索。此外,我们设计双分支权重共享(BIWS)训练策略以实现快速模型评估。大量实验表明,所搜索的架构(命名为AutoBERT-Zero)在各种下游任务中显著优于不同模型容量的BERT及其变体,证明了该架构的迁移与扩展能力。值得注意的是,AutoBERT-Zero-base在GLUE测试集上以2.4和1.4的更高分数优于RoBERTa-base(使用更多数据)和BERT-large(具有更大模型规模)。
引用
@article{arxiv.2107.07445,
title = {AutoBERT-Zero: Evolving BERT Backbone from Scratch},
author = {Jiahui Gao and Hang Xu and Han Shi and Xiaozhe Ren and Philip L. H. Yu and Xiaodan Liang and Xin Jiang and Zhenguo Li},
journal= {arXiv preprint arXiv:2107.07445},
year = {2022}
}
备注
Accepted by AAAI-2022