中文

预训练语言模型可迁移性的探究

计算与语言 2020-11-11 v2 人工智能 机器学习

摘要

语言模型预训练如何助力迁移学习?我们考虑一种简单的消融技术,用于确定每个预训练层对迁移任务性能的影响。该方法称为部分重初始化,即用随机权重替换预训练模型的不同层,然后在迁移任务上对整个模型进行微调并观察性能变化。该技术揭示:在 BERT 中,在下游 GLUE 任务上探测性能高的层,对于这些任务的高准确率既非必要也非充分。此外,使用某层的预训练参数所带来的收益随微调数据集规模变化显著:在数据充足时提供巨大性能提升的参数,在数据稀缺设定下可能收益甚微。这些结果揭示了迁移学习过程的复杂性,凸显了在冻结模型或单数据样本上操作的方法之局限。

关键词

引用

@article{arxiv.2004.14975,
  title  = {Investigating Transferability in Pretrained Language Models},
  author = {Alex Tamkin and Trisha Singh and Davide Giovanardi and Noah Goodman},
  journal= {arXiv preprint arXiv:2004.14975},
  year   = {2020}
}

备注

Findings of EMNLP 2020