FL-Tuning:Transformer 中前馈网络的层调优
计算与语言
2022-07-01 v1 机器学习
摘要
提示调优(prompt tuning)是将预训练语言模型适配到下游任务的一种新兴方式。然而,现有研究主要是将提示添加到输入序列中。由于中间的多头自注意力与前馈网络计算,这种方式无法如预期般工作,使得模型优化不够平滑。因此,我们提出一种称为层调优(layer tuning)的新型调优方式,旨在 Transformer 层中增加可学习参数。具体而言,我们关注 Transformer 中前馈网络的层调优,即 FL-tuning。它在每个前馈网络的隐藏层中引入额外单元。我们在公开 CLUE 基准上进行了大量实验。结果表明:1)在几乎全部情况下,我们的 FL-tuning 在全数据与少样本设置下均优于提示调优方法。特别地,在 WSC 1.0 上准确率较 P-tuning v2 提升 17.93%(全数据设置),在 CLUENER 上 F1 较 P-tuning v2 提升 16.142%(少样本设置)。2)我们的 FL-tuning 更稳定,且收敛速度约为 P-tuning v2 的 1.17 倍。3)仅训练约 3% 的 Transformer 参数,FL-tuning 在大多数数据集上与微调(fine-tuning)相当,并在若干数据集上显著优于微调(例如在 WSC 1.1 上准确率提升 12.9%)。源代码见 https://github.com/genggui001/FL-Tuning。
引用
@article{arxiv.2206.15312,
title = {FL-Tuning: Layer Tuning for Feed-Forward Network in Transformer},
author = {Jingping Liu and Yuqiu Song and Kui Xue and Hongli Sun and Chao Wang and Lihan Chen and Haiyun Jiang and Jiaqing Liang and Tong Ruan},
journal= {arXiv preprint arXiv:2206.15312},
year = {2022}
}