中文

论语言编码器的手术式微调

计算与语言 2023-10-27 v1 人工智能 信息检索

摘要

对预训练神经语言编码器所有层进行微调(无论是使用全部参数还是参数高效方法)通常是将其适配到新任务的事实标准做法。我们提供的证据表明,对于不同的下游语言任务,仅微调部分层就足以获得接近且常常优于微调编码器所有层的性能。我们提出了一种基于费雪信息矩阵(FIM)对角元素的高效度量(FIM 分数),用于筛选选择性微调的候选层。我们在 GLUE 和 SuperGLUE 任务上以及不同的语言编码器上通过实验表明,该度量能有效选出带来强劲下游性能的层。我们的工作强调,与给定下游任务相关的任务特定信息往往局部存在于少数层中,仅微调这些层便足以获得强劲性能。此外,我们证明了 FIM 分数在层排序上的鲁棒性,该排序在优化过程中保持恒定。

关键词

引用

@article{arxiv.2310.17041,
  title  = {On Surgical Fine-tuning for Language Encoders},
  author = {Abhilasha Lodha and Gayatri Belapurkar and Saloni Chalkapurkar and Yuanming Tao and Reshmi Ghosh and Samyadeep Basu and Dmitrii Petrov and Soundararajan Srinivasan},
  journal= {arXiv preprint arXiv:2310.17041},
  year   = {2023}
}

备注

Accepted to EMNLP 2023