中文

领域适配器混合:解耦并向预训练语言模型记忆中注入领域知识

计算与语言 2023-06-09 v1

摘要

预训练语言模型(PLMs)在通用领域文本理解上表现出色,但在特定领域却表现不佳。尽管在大型领域特定语料上继续预训练是有效的,但对该领域所有参数进行调优代价高昂。在本文中,我们研究是否可以通过仅调优少量参数来既有效又高效地适配 PLMs。具体而言,我们将 Transformer 架构的前馈网络(FFNs)解耦为两部分:原始预训练 FFNs 以维持旧领域知识,以及我们新颖的领域特定适配器以并行注入领域特定知识。然后我们采用适配器混合门来动态融合来自不同领域适配器的知识。我们提出的领域适配器混合(MixDA)采用两阶段适配器调优策略,利用无标签数据和有标签数据来辅助领域适配:i)在无标签数据上的领域特定适配器;随后 ii)在有标签数据上的任务特定适配器。MixDA 可无缝插入预训练-微调范式,我们的实验表明 MixDA 在领域内任务(GLUE)、域外任务(ChemProt、RCT、IMDB、Amazon)和知识密集型任务(KILT)上均取得优越性能。进一步分析证明了我们方法的可靠性、可扩展性和高效性。代码见 https://github.com/Amano-Aki/Mixture-of-Domain-Adapters。

关键词

引用

@article{arxiv.2306.05406,
  title  = {Mixture-of-Domain-Adapters: Decoupling and Injecting Domain Knowledge to Pre-trained Language Models Memories},
  author = {Shizhe Diao and Tianyang Xu and Ruijia Xu and Jiawei Wang and Tong Zhang},
  journal= {arXiv preprint arXiv:2306.05406},
  year   = {2023}
}

备注

ACL 2023