中文

PAC-tuning:基于PAC驱动的扰动梯度下降微调预训练语言模型

机器学习 2023-10-27 v1 计算与语言

摘要

为下游任务微调预训练语言模型(PLMs)是一个大规模优化问题,其中训练算法的选择关键地决定了训练模型对未见测试数据的泛化能力,尤其在少样本学习情境下。为获得良好泛化性能并避免过拟合,常采用数据增强与剪枝等技术。然而,增添这些正则化需要对优化算法(如流行的Adam优化器)的超参数进行大量调优。本文提出一种两阶段微调方法PAC-tuning以应对该优化挑战。首先,基于PAC-Bayes训练,PAC-tuning直接最小化PAC-Bayes泛化界以学习恰当的参数分布。其次,PAC-tuning通过在训练中将第一阶段学到的方差所生成的噪声注入模型参数来修正梯度,从而得到扰动梯度下降(PGD)的一个变体。以往,少样本场景因PAC-Bayes界在应用于大数据量有限训练数据的模型时可能不够紧致,而给PAC-Bayes训练带来困难。我们在5项GLUE基准任务上的实验结果表明,PAC-tuning成功应对了微调任务的挑战,并以可见优势超越强基线方法,进一步确认了将PAC训练应用于当前使用Adam优化器训练的任何其他设置的潜力。

关键词

引用

@article{arxiv.2310.17588,
  title  = {PAC-tuning:Fine-tuning Pretrained Language Models with PAC-driven Perturbed Gradient Descent},
  author = {Guangliang Liu and Zhiyu Xue and Xitong Zhang and Kristen Marie Johnson and Rongrong Wang},
  journal= {arXiv preprint arXiv:2310.17588},
  year   = {2023}
}

备注

Accepted to EMNLP23 main