基于预训练模型的自然语言理解中间任务迁移学习:何时及为何有效?
计算与语言
2020-05-12 v2
摘要
尽管诸如 BERT 之类的预训练模型在自然语言理解任务上取得了大幅增益,但通过在数据丰富的中间任务上进一步训练模型,再在目标任务上微调,可改进其性能。然而,对于给定目标任务,中间任务训练何时以及为何有益,目前仍知之甚少。为此,我们基于预训练的 RoBERTa 模型,使用 110 种中间–目标任务组合进行了大规模研究。我们进一步用 25 个探测任务评估所有训练模型,以揭示驱动迁移的具体技能。我们观察到,需要高级推理与推断能力的中间任务往往效果最佳。我们还观察到目标任务性能与指代消解等高级能力高度相关。然而,我们未能观察到探测任务与目标任务性能之间更细粒度的相关性,这凸显了构建广泛覆盖探测基准的进一步工作的必要性。我们还观察到证据表明,预训练期间所学知识的遗忘可能限制我们的分析,凸显了在此类设定下迁移学习方法的进一步工作的必要性。
引用
@article{arxiv.2005.00628,
title = {Intermediate-Task Transfer Learning with Pretrained Models for Natural Language Understanding: When and Why Does It Work?},
author = {Yada Pruksachatkun and Jason Phang and Haokun Liu and Phu Mon Htut and Xiaoyi Zhang and Richard Yuanzhe Pang and Clara Vania and Katharina Kann and Samuel R. Bowman},
journal= {arXiv preprint arXiv:2005.00628},
year = {2020}
}
备注
ACL 2020