预训练 Transformer 中微调与句级探测语言知识之间的相互作用
计算与语言
2020-10-07 v1 机器学习
摘要
微调预训练上下文嵌入模型已成为 NLP 流程中不可或缺的一部分。与此同时,探测(probing)作为一种考察预训练模型所捕获语言知识的方式而出现。然而,关于微调如何影响预训练模型的表示及其所编码的语言知识,目前知之甚少。本文致力于缩小这一差距。我们研究了三种不同的预训练模型:BERT、RoBERTa 与 ALBERT,并通过句级探测考察微调如何影响其表示。我们发现,对于某些探测任务,微调导致准确率发生显著变化,这可能表明微调为预训练模型引入甚至移除了语言知识。然而,这些变化在不同模型、微调与探测任务之间差异巨大。我们的分析揭示,虽然微调确实改变了预训练模型的表示,且这些改变在较高层通常更大,但仅在极少数情况下,微调对探测准确率的积极影响大于仅使用带强池化方法的预训练模型。基于我们的发现,我们认为微调对探测的正面和负面效应都需要谨慎解读。
引用
@article{arxiv.2010.02616,
title = {On the Interplay Between Fine-tuning and Sentence-level Probing for Linguistic Knowledge in Pre-trained Transformers},
author = {Marius Mosbach and Anna Khokhlova and Michael A. Hedderich and Dietrich Klakow},
journal= {arXiv preprint arXiv:2010.02616},
year = {2020}
}
备注
Accepted at Findings of EMNLP 2020 and BlackboxNLP 2020