微调过程中 BERT 嵌入发生了什么变化?
计算与语言
2020-05-01 v1
摘要
尽管近期有许多研究探讨语言信息如何编码于预训练句子表示中,但对于这些模型在适配以解决下游任务时如何变化却知之甚少。利用一套分析技术(探测分类器、表示相似性分析和模型消融),我们研究了微调如何影响 BERT 模型的表示。我们发现,虽然微调必然带来显著变化,但它不会导致对语言现象的灾难性遗忘。我们反而发现微调主要影响 BERT 的顶层,但在不同任务间存在值得注意的差异。特别是,依存句法分析重构了模型的绝大部分,而 SQuAD 和 MNLI 似乎涉及更浅层的处理。最后,我们还发现微调对域外句子表示的影响较弱,表明模型泛化方面仍有改进空间。
引用
@article{arxiv.2004.14448,
title = {What Happens To BERT Embeddings During Fine-tuning?},
author = {Amil Merchant and Elahe Rahimtoroghi and Ellie Pavlick and Ian Tenney},
journal= {arXiv preprint arXiv:2004.14448},
year = {2020}
}
备注
9 pages (not including references), 5 figures