中文

用于改进与解释预训练语言模型的语言专家混合适配器

计算与语言 2023-10-26 v1

摘要

本文中,我们提出了一种方法,通过在参数高效微调(PEFT)设定下将语言结构注入预训练语言模型,结合了两个不同的热门研究方向。在我们的方法中,编码不同语言结构的并行适配器模块使用一种新颖的语言专家混合(Mixture-of-Linguistic-Experts)架构进行组合,其中Gumbel-Softmax门控用于确定这些模块在模型每一层的重要性。为减少参数量,我们首先将模型固定训练少量步数,随后依据重要性分数对专家进行剪枝。我们使用三种不同预训练模型的实验结果表明,我们的方法能以可比的参数量优于SOTA PEFT方法。此外,我们提供了额外分析以考察每个模型在每一层所选用的专家,从而为未来研究提供见解。

关键词

引用

@article{arxiv.2310.16240,
  title  = {Mixture-of-Linguistic-Experts Adapters for Improving and Interpreting Pre-trained Language Models},
  author = {Raymond Li and Gabriel Murray and Giuseppe Carenini},
  journal= {arXiv preprint arXiv:2310.16240},
  year   = {2023}
}

备注

14 pages, 3 figures, Camera-Ready for EMNLP 2023 Findings (Long Paper)