可视化与理解BERT的有效性
计算与语言
2019-08-16 v1 机器学习
摘要
语言模型预训练,如BERT,已在许多NLP任务中取得显著成果。然而,为何‘预训练而后微调’的范式能够提升不同任务上的性能与泛化能力仍不清楚。本文中,我们提出对在特定数据集上微调BERT的损失景观与优化轨迹进行可视化。首先,我们发现预训练在下游任务上到达了一个良好的初始点,与从头训练相比带来了更宽的优化极值和更易的优化。我们还证明,尽管BERT对下游任务高度过参数化,微调过程对过拟合具有鲁棒性。其次,可视化结果表明,微调BERT因平坦而宽的极值以及训练损失面与泛化误差面之间的一致性而倾向于更好的泛化。第三,BERT的较低层在微调期间更具不变性,这表明靠近输入的层学到了更具可迁移性的语言表示。
引用
@article{arxiv.1908.05620,
title = {Visualizing and Understanding the Effectiveness of BERT},
author = {Yaru Hao and Li Dong and Furu Wei and Ke Xu},
journal= {arXiv preprint arXiv:1908.05620},
year = {2019}
}
备注
Accepted by EMNLP-19