中文

基于共享超网络实现 Transformer 参数高效多任务微调

计算与语言 2021-06-09 v1

摘要

最先进的参数高效微调方法依赖于在预训练语言模型的层之间引入适配器模块。然而,此类模块针对每个任务单独训练,因此无法实现跨任务的信息共享。在本文中,我们展示了可以通过使用共享超网络为所有层和任务生成适配器参数,这些超网络以 transformer 模型中的任务、适配器位置和层 id 为条件。这一参数高效的多任务学习框架使我们能够通过超网络跨任务共享知识,同时借助任务特定的适配器使模型适应各个任务,从而兼得两者之长。在著名的 GLUE 基准上的实验表明,在多任务学习中取得了更好的性能,而每个任务仅增加 0.29% 的参数。我们还展示了在各种任务的少样本领域泛化中的显著性能提升。我们的代码公开于 https://github.com/rabeehk/hyperformer。

关键词

引用

@article{arxiv.2106.04489,
  title  = {Parameter-efficient Multi-task Fine-tuning for Transformers via Shared Hypernetworks},
  author = {Rabeeh Karimi Mahabadi and Sebastian Ruder and Mostafa Dehghani and James Henderson},
  journal= {arXiv preprint arXiv:2106.04489},
  year   = {2021}
}

备注

accepted in ACL, 2021