细察微调如何改变 BERT
计算与语言
2022-03-17 v3
摘要
鉴于预训练上下文表示在当今 NLP 中的普遍使用,已有许多工作致力于理解它们包含哪些信息,以及为何它们似乎具有普遍的成功性。使用这些表示最常见的方式是针对终端任务对其进行微调。然而,微调如何改变底层嵌入空间却较少被研究。在本工作中,我们研究英语 BERT 系列,并使用两种探测技术分析微调如何改变该空间。我们假设微调通过增大与不同标签相关联的样本之间的距离来影响分类性能。我们通过针对五个不同 NLP 任务的精心设计的实验证实了该假设。通过这些实验,我们还发现了“微调总能提升性能”这一主流观点的一例例外。最后,通过比较微调前后的表示,我们发现微调并未给表示引入任意改变;相反,它在很大程度上保持数据点的原始空间结构的同时,将表示调整至下游任务。
引用
@article{arxiv.2106.14282,
title = {A Closer Look at How Fine-tuning Changes BERT},
author = {Yichu Zhou and Vivek Srikumar},
journal= {arXiv preprint arXiv:2106.14282},
year = {2022}
}
备注
Camera ready for ACL 2022