MerA:用于少样本学习的预训练适配器合并
计算与语言
2023-08-31 v1
摘要
适配器微调仅更新少量参数,已成为将预训练语言模型微调至下游任务的主流方法。然而,其在少样本学习中常产生次优结果。AdapterFusion通过针对特定任务的组合层组装预训练适配器是一种可能的解决方案,但显著增加了可训练参数与部署成本。尽管如此,我们的初步研究表明,即使在少样本学习中单个适配器也可优于AdapterFusion,这促使我们提出\textbf{\texttt{Merging Pretrained Adapters}}(MerA),通过模型融合将预训练适配器高效整合至单一模型。在两个PLM上的大量实验表明,MerA相较单个适配器与AdapterFusion均取得显著提升。为进一步增强MerA的能力,我们还引入了一种简单而有效的技术,称为“\textit{same-track}”设置,用于合并来自同一预训练任务轨线的适配器。采用“\textit{same-track}”设置后,我们观察到更令人印象深刻的增益,大幅超越全微调与适配器微调的性能,例如在MRPC上3.5%、在MNLI上5.0%。
引用
@article{arxiv.2308.15982,
title = {MerA: Merging Pretrained Adapters For Few-Shot Learning},
author = {Shwai He and Run-Ze Fan and Liang Ding and Li Shen and Tianyi Zhou and Dacheng Tao},
journal= {arXiv preprint arXiv:2308.15982},
year = {2023}
}