中文

模块化是否可迁移?基于知识蒸馏视角的案例研究

计算与语言 2024-03-28 v1

摘要

模块化深度学习的兴起展示了其在各种自然语言处理应用中的潜力。参数高效微调(PEFT)模块化已被证明适用于从领域适应到多语言设置的各种用例。然而,所有这些工作都涵盖了模块组件在单一预训练语言模型(PLM)内训练和部署的情况。这种特定于模型的设置对模块化架构试图实现的模块化本身构成了实质性限制。我们探讨当前的模块化方法是否可以在模型之间迁移,以及我们是否可以将模块从更稳健且更大的PLM迁移到较小的PLM。在这项工作中,我们旨在通过常用于模型压缩的知识蒸馏视角来填补这一空白,并提出一种极其直接的方法,在同族PLM之间迁移预训练的、特定任务的PEFT模块。此外,我们提出了一种方法,允许在不改变推理复杂度的情况下在不兼容的PLM之间迁移模块。在多种语言和PEFT方法上对命名实体识别、自然语言推理和释义识别任务进行的实验,展示了可迁移模块化的初步潜力。

关键词

引用

@article{arxiv.2403.18804,
  title  = {Is Modularity Transferable? A Case Study through the Lens of Knowledge Distillation},
  author = {Mateusz Klimaszewski and Piotr Andruszkiewicz and Alexandra Birch},
  journal= {arXiv preprint arXiv:2403.18804},
  year   = {2024}
}

备注

Accepted at LREC-COLING 2024