BERT 的输出层能识别所有隐藏层?若干有趣现象与一种简单的 BERT 提升方法
计算与语言
2021-02-16 v2 机器学习
摘要
尽管基于 Transformer 的双向编码器表示(BERT)已在众多自然语言处理(NLP)任务中取得巨大成功,其仍是一个黑箱。多种先前工作试图揭开 BERT 的面纱并理解每一层的功能。在本文中,我们发现一个令人惊讶的事实:BERT 的输出层可直接将 BERT 的每一层作为输入来重建输入句子,即便输出层除最终隐藏层外从未见过输入。这一事实在各类 BERT 基模型上均成立,即便某些层被复制也是如此。基于该观察,我们提出一种极为简单的方法来提升 BERT 的性能。通过在 BERT 基模型中复制若干层使其更深(此步骤无需额外训练),这些模型在微调后的下游任务中获得了更好的性能。
引用
@article{arxiv.2001.09309,
title = {BERT's output layer recognizes all hidden layers? Some Intriguing Phenomena and a simple way to boost BERT},
author = {Wei-Tsung Kao and Tsung-Han Wu and Po-Han Chi and Chun-Cheng Hsieh and Hung-Yi Lee},
journal= {arXiv preprint arXiv:2001.09309},
year = {2021}
}
备注
7 pages, 8 figures, 3 tables