中文

参数高效微调中 Transformer 模块可迁移性的实证研究

计算与语言 2023-02-23 v2

摘要

参数高效微调方法近来备受关注。由于可训练权重数量大幅减少,这些方法可带来可扩展性与计算有效性。在本文中,我们寻找最优子网络,并研究不同 transformer 模块将知识从预训练模型迁移到下游任务的能力。我们的实证结果表明,BERT 中的每个 transformer 模块都可充当赢家票(winning ticket):在冻结网络其余部分的同时微调每个特定模块,可取得与全量微调相当的性能。在不同模块中,LayerNorm 在有限可训练权重下展现出最佳的知识迁移能力,以至于在逐层分析中仅用全部参数的 0.003%,便能在多种目标任务上表现出可接受的性能。关于其有效性背后的原因,我们认为其显著性能可归因于相较于预训练 BERT 中其他模块的高幅值权重。

关键词

引用

@article{arxiv.2302.00378,
  title  = {An Empirical Study on the Transferability of Transformer Modules in Parameter-Efficient Fine-Tuning},
  author = {Mohammad Akbar-Tajari and Sara Rajaee and Mohammad Taher Pilehvar},
  journal= {arXiv preprint arXiv:2302.00378},
  year   = {2023}
}

备注

Accepted at EMNLP 2022 (main conference), https://aclanthology.org/2022.emnlp-main.726