中文

迁移学习如何影响深度 NLP 模型中的语言知识

计算与语言 2021-06-01 v1

摘要

近年来,从预训练神经语言模型向下游任务进行迁移学习已成为 NLP 中的主流主题。若干研究者已表明,深度 NLP 模型学习到了大量的语言知识,并捕获于模型的不同层中。我们研究了向下游 NLP 任务微调如何影响已学习的语言知识。我们使用层和神经元级别的诊断分类器,在流行的预训练模型 BERT、RoBERTa 和 XLNet 上开展了一项研究。我们发现,对于某些 GLUE 任务,网络依赖于核心语言信息并将其在网络中更深地保留,而对于其他任务则会遗忘。语言信息在预训练语言模型中呈分布式,但在微调后局部化到较低层,将较高层留给任务特定知识。该模式在不同架构间有所差异:与 RoBERTa 和 XLNet 相比,BERT 相对更深地在网络中保留了语言信息,而在后两者中语言信息主要被下放至较低层。

关键词

引用

@article{arxiv.2105.15179,
  title  = {How transfer learning impacts linguistic knowledge in deep NLP models?},
  author = {Nadir Durrani and Hassan Sajjad and Fahim Dalvi},
  journal= {arXiv preprint arXiv:2105.15179},
  year   = {2021}
}

备注

Findings of the ACL 2021