中文

BERMo:BERT 能从 ELMo 中学到什么?

计算与语言 2021-11-01 v1 机器学习

摘要

我们提出 BERMo,一种对 BERT 的架构修改,其基于表面、句法和语义语言特征的层次结构进行预测。我们使用来自语言模型的嵌入(ELMo)中提出的线性组合方案,来组合来自不同网络深度的缩放内部表示。我们的方法具有双重好处:(1)下游任务的梯度流得到改善,因为每一层都与损失函数的梯度有直接连接;(2)表征能力增强,因为模型不再需要复制浅层中学到的、对下游任务必要的特征。此外,我们的模型参数开销可忽略不计,因为网络中每一层仅关联一个标量参数。在 SentEval 数据集的探测任务上的实验表明,我们的模型在准确率上比基线最高提升 4.65%4.65\%,在语义任务上平均提升 2.67%2.67\%。当施加压缩技术时,我们发现我们的模型能够对像 SST-2 这样的小数据集实现稳定剪枝,而 BERT 模型通常会在此发散。我们观察到,在 GLUE 数据集的 MNLI 和 QQP 任务上,我们的方法分别比基线快 1.67×1.67\times1.15×1.15\times 收敛。此外,我们的结果表明,在 QQP 任务上,对于基于惩罚的剪枝方法,我们的方法能获得更好的参数效率。

关键词

引用

@article{arxiv.2110.15802,
  title  = {BERMo: What can BERT learn from ELMo?},
  author = {Sangamesh Kodge and Kaushik Roy},
  journal= {arXiv preprint arXiv:2110.15802},
  year   = {2021}
}