中文

面向自然语言处理的参数高效迁移学习

机器学习 2019-06-14 v2 计算与语言 机器学习

摘要

微调大型预训练模型是 NLP 中一种有效的迁移机制。然而,在面对众多下游任务时,微调在参数上效率低下:每个任务都需一个全新的模型。作为替代方案,我们提出使用适配器模块进行迁移。适配器模块产生紧凑且可扩展的模型;每个任务仅增加少量可训练参数,且新任务可在不重访旧任务的前提下添加。原始网络的参数保持固定,从而实现高度的参数共享。为验证适配器的有效性,我们将近期提出的 BERT Transformer 模型迁移至 26 项多样化的文本分类任务,包括 GLUE 基准。适配器取得了接近最先进的性能,同时每个任务仅增加少量参数。在 GLUE 上,我们达到全微调性能 0.4% 以内的水平,每个任务仅增加 3.6% 的参数。相比之下,微调每个任务需训练 100% 的参数。

关键词

引用

@article{arxiv.1902.00751,
  title  = {Parameter-Efficient Transfer Learning for NLP},
  author = {Neil Houlsby and Andrei Giurgiu and Stanislaw Jastrzebski and Bruna Morrone and Quentin de Laroussilhe and Andrea Gesmundo and Mona Attariyan and Sylvain Gelly},
  journal= {arXiv preprint arXiv:1902.00751},
  year   = {2019}
}