FlexiBERT:当前 Transformer 架构是否过于同质与僵化?
机器学习
2022-05-25 v1 计算与语言
摘要
大量语言模型的存在使得为定制任务选择最佳模型变得困难。大多数最先进的方法利用基于 transformer 的模型(如 BERT)或其变体。然而,训练此类模型并探索其超参数空间在计算上代价高昂。先前工作提出了几种采用性能预测器(如代理模型)的神经架构搜索(NAS)方法来解决该问题;但分析仅限于在网络中全程使用固定维度的同质模型。这导致次优架构。为解决此局限,我们提出一套异构且灵活的模型,即 FlexiBERT,其具有 varied 编码器层、多样的可能操作集和不同的隐藏维度。为在该扩展设计空间中进行更良好的代理建模,我们提出了一种基于图相似度的新嵌入方案。我们还提出了一种名为 BOSHNAS 的新颖 NAS 策略,它利用该新方案、贝叶斯建模和二阶优化,快速训练并使用神经代理模型以收敛到最优架构。一组综合实验表明,当应用于 FlexiBERT 设计空间时,所提策略相比传统模型将性能边界向上推进。我们提出的模型之一 FlexiBERT-Mini 比 BERT-Mini 少 3% 的参数,并在 GLUE 分数上高出 8.9%。一个性能等同于最佳同质模型的 FlexiBERT 模型实现了 2.6 倍更小的规模。另一提出的模型 FlexiBERT-Large 取得了最先进结果,在 GLUE 基准上至少超越基线模型 5.7%。
引用
@article{arxiv.2205.11656,
title = {FlexiBERT: Are Current Transformer Architectures too Homogeneous and Rigid?},
author = {Shikhar Tuli and Bhishma Dedhia and Shreshth Tuli and Niraj K. Jha},
journal= {arXiv preprint arXiv:2205.11656},
year = {2022}
}
备注
Preprint. In review