中文

TADA:面向 Transformer 的高效任务无关域适应方法

计算与语言 2023-05-23 v1 机器学习

摘要

在领域特定数据上对基于预训练 transformer 的语言模型进行中间训练,可为下游任务带来显著收益。为提高效率并缓解完整域自适应预训练带来的灾难性遗忘,已开发出适配器等方法。然而,这些方法为每一层引入额外参数,且被批评表达能力有限。本工作中,我们提出 TADA,一种新颖的任务无关域适应方法,其具有模块化、参数高效因而数据高效的特点。在 TADA 中,我们重训嵌入层以学习 transformer 编码器的领域感知输入表示和分词器,同时冻结模型所有其他参数。随后进行任务特定的微调。我们进一步使用元嵌入和新引入的元分词器开展实验,在多领域用例中为每个任务得到单一模型。我们在涵盖单领域与多领域设置及高、低资源场景的 14 个领域 4 个下游任务上的广泛评估表明,TADA 是完整域自适应预训练和适配器用于域适应的高效替代方案,且不引入额外参数或复杂训练步骤。

关键词

引用

@article{arxiv.2305.12717,
  title  = {TADA: Efficient Task-Agnostic Domain Adaptation for Transformers},
  author = {Chia-Chien Hung and Lukas Lange and Jannik Strötgen},
  journal= {arXiv preprint arXiv:2305.12717},
  year   = {2023}
}

备注

ACL-Findings 2023