中文

AdapterHub:一种用于适配 Transformer 的框架

计算与语言 2020-10-07 v3

摘要

当前自然语言处理(NLP)的惯常做法是将由数百万或数十亿参数组成的预训练模型下载并微调。存储和共享如此庞大的训练模型成本高昂、缓慢且耗时,这阻碍了朝向能从众多任务中学习并服务于众多任务的更通用、更通用 NLP 方法的进展。适配器(adapter)——插入预训练模型每一层内的小型已学习瓶颈层——通过避免对整个模型进行完全微调来缓解此问题。然而,共享和集成适配器层并非易事。我们提出 AdapterHub,一个允许针对不同任务和语言动态“缝合接入”预训练适配器的框架。该框架构建于流行的 HuggingFace Transformers 库之上,使得最先进预训练模型(例如 BERT、RoBERTa、XLM-R)跨任务和语言的适配极其轻松快捷。借助对训练脚本的最小改动和专门的基础设施,适配器的下载、共享和训练尽可能无缝。我们的框架实现了对任务特定模型共享的可扩展且便捷的访问,尤其在低资源场景下。AdapterHub 包含了所有近期适配器架构,可在 https://AdapterHub.ml 获取。

关键词

引用

@article{arxiv.2007.07779,
  title  = {AdapterHub: A Framework for Adapting Transformers},
  author = {Jonas Pfeiffer and Andreas Rücklé and Clifton Poth and Aishwarya Kamath and Ivan Vulić and Sebastian Ruder and Kyunghyun Cho and Iryna Gurevych},
  journal= {arXiv preprint arXiv:2007.07779},
  year   = {2020}
}

备注

EMNLP 2020: Systems Demonstrations