Sensi-BERT:面向敏感性驱动的参数高效 BERT 微调
计算与语言
2023-09-01 v2
摘要
大型预训练语言模型近期因在文本分类和问答等多种下游任务上性能提升且仅需少量微调轮次而备受关注。然而,其庞大的模型规模常阻碍在资源受限的边缘设备上应用。现有生成参数高效 BERT 模型的方案在很大程度上依赖计算密集的训练与微调,且常借助额外的计算繁重模型来缓解性能差距。本文提出 Sensi-BERT,一种敏感性驱动的高效 BERT 微调方法,可接收现成的预训练 BERT 模型并为下游任务生成高度参数高效的模型。具体而言,我们进行敏感性分析以对每个参数张量排序,进而在给定参数或 FLOPs 预算的微调过程中相应裁剪它们。我们的实验在 MNLI、QQP、QNLI、SST-2 和 SQuAD 等不同下游任务上展示了 Sensi-BERT 的有效性,在相似或更少参数预算下相较多种替代方案表现更优。
引用
@article{arxiv.2307.11764,
title = {Sensi-BERT: Towards Sensitivity Driven Fine-Tuning for Parameter-Efficient BERT},
author = {Souvik Kundu and Sharath Nittur Sridhar and Maciej Szankin and Sairam Sundaresan},
journal= {arXiv preprint arXiv:2307.11764},
year = {2023}
}
备注
6 pages, 5 figures, 2 tables