中文

LayerNorm:参数高效微调中的关键组件

计算与语言 2024-04-01 v1 机器学习

摘要

微调预训练模型(如来自Transformer的双向编码器表示(BERT))已被证明是解决许多自然语言处理(NLP)任务的有效方法。然而,由于许多最先进的NLP模型(包括BERT)参数数量庞大,微调过程计算成本高昂。解决这个问题的一个有吸引力的方案是参数高效微调,即只修改模型的最小部分而保持其余部分不变。然而,目前尚不清楚BERT模型的哪一部分对微调至关重要。在本文中,我们首先分析BERT模型中的不同组件,以确定在微调后哪个组件发生了最显著的变化。我们发现,当针对不同的通用语言理解评估(GLUE)任务进行微调时,输出LayerNorm的变化比其他任何组件都大。然后我们证明,仅微调LayerNorm可以达到与完全微调和其他参数高效微调方法相当甚至更好的性能。此外,我们使用Fisher信息来确定LayerNorm中最关键的子集,并证明GLUE基准测试中的许多NLP任务可以通过仅微调一小部分LayerNorm来解决,且性能下降可忽略不计。

关键词

引用

@article{arxiv.2403.20284,
  title  = {LayerNorm: A key component in parameter-efficient fine-tuning},
  author = {Taha ValizadehAslani and Hualou Liang},
  journal= {arXiv preprint arXiv:2403.20284},
  year   = {2024}
}