中文

何时对预训练编码器迁移学习使用多任务学习与中间微调

计算与语言 2022-05-18 v1

摘要

近年来,随着预训练模型展现出令人印象深刻的迁移到新任务的能力,自然语言处理(NLP)中的迁移学习(TL)引起了人们的极大兴趣。在微调期间利用多个监督数据集出现了三种主要策略:在目标任务训练之前先在中间任务上训练(STILTs),使用多任务学习(MTL)在辅助任务和目标任务上进行联合训练(成对MTL),或者简单地使用MTL在所有可用数据集上进行联合训练(MTL-ALL)。在这项工作中,我们在GLUE数据集套件上进行了全面分析,比较了所有三种TL方法。我们发现,对于何时使用其中一种技术而非另一种,存在一个简单的启发式规则:当目标任务比支持任务的实例更少时,成对MTL优于STILTs,反之亦然。我们证明,这在GLUE数据集上超过92%的适用案例中成立,并通过改变数据集大小的实验验证了这一假设。这个启发式规则的简单性和有效性令人惊讶,值得TL社区进一步探索。此外,我们发现MTL-ALL在几乎所有情况下都劣于成对方法。我们希望这项研究能帮助其他人在为NLP任务选择TL方法时做出决策。

关键词

引用

@article{arxiv.2205.08124,
  title  = {When to Use Multi-Task Learning vs Intermediate Fine-Tuning for Pre-Trained Encoder Transfer Learning},
  author = {Orion Weller and Kevin Seppi and Matt Gardner},
  journal= {arXiv preprint arXiv:2205.08124},
  year   = {2022}
}

备注

ACL 2022