面向预训练语言模型的层归一化参数高效微调
计算与语言
2022-12-12 v3
摘要
鉴于当前预训练语言模型(PLM)的规模,常规微调面临日益增大的困难,这使得参数高效微调成为前沿研究的焦点。该领域以往的方法在 Transformer 块的 MHA 或/和 FFN 中插入可微调适配器,以使 PLM 获得可迁移性。然而,作为 Transformer 架构的重要组成部分,层归一化在参数高效微调中的作用被忽视。本文首次提出 LN-tuning,仅通过微调层归一化模块的增益与偏置项(占参数 0.03%),即具有高时间效率,且显著优于可微调参数少于 0.1% 的基线方法。进一步,我们研究了将 LN-tuning 与以往方法结合的统一框架,并发现:(1)将 prefix-tuning(作用于 MHA 的基于适配器的方法)、LN-tuning 相结合的统一框架达到了 SOTA 性能;(2)同时微调 MHA 与 LayerNorm 的统一框架可获得性能提升,而同时微调 FFN 与 LayerNorm 的框架则会导致性能下降。消融实验验证了 LN-tuning 无冗余参数,并进一步加深了对它的理解。
引用
@article{arxiv.2211.08682,
title = {Parameter-Efficient Tuning on Layer Normalization for Pre-trained Language Models},
author = {Wang Qi and Yu-Ping Ruan and Yuan Zuo and Taihao Li},
journal= {arXiv preprint arXiv:2211.08682},
year = {2022}
}