一种用于理解机器阅读理解中 BERT 微调的成对探针
计算与语言
2020-06-03 v1 信息检索
摘要
预训练模型为许多 NLP 任务带来了显著改进,并已被广泛分析。但关于微调对特定任务的影响知之甚少。直观上,人们可能同意预训练模型已经学习了单词的语义表示(例如,同义词彼此更接近),而微调进一步提高了其需要更复杂推理的能力(例如,共指消解、实体边界检测等)。然而,如何分析性和定量地验证这些论点是一项具有挑战性的任务,并且很少有工作关注这一主题。在本文中,受大多数探针任务涉及识别匹配的短语对(例如,共指需要匹配实体和代词)这一观察的启发,我们提出了一种成对探针来理解机器阅读理解 (MRC) 任务上的 BERT 微调。具体而言,我们识别了 MRC 中的五种现象。根据成对探针任务,我们比较了预训练和微调 BERT 每层隐藏表示的性能。所提出的成对探针缓解了模型训练不准确带来的干扰问题,并进行了稳健的定量比较。我们的实验分析得出了高度可信的结论:(1) 微调对基础和低级信息以及一般语义任务几乎没有影响。(2) 对于下游任务所需的特定能力,微调后的 BERT 优于预训练的 BERT,并且这种差距在第五层之后变得明显。
引用
@article{arxiv.2006.01346,
title = {A Pairwise Probe for Understanding BERT Fine-Tuning on Machine Reading Comprehension},
author = {Jie Cai and Zhengzhou Zhu and Ping Nie and Qian Liu},
journal= {arXiv preprint arXiv:2006.01346},
year = {2020}
}
备注
e.g.: 4 pages, 1 figure