以模型集成替代提示融合:一种用于少样本提示调优的样本特定知识迁移方法
计算与语言
2023-03-02 v3
摘要
提示调优方法通过针对下游任务在冻结的预训练模型上学习任务特定的软提示,因其参数高效性而受到越来越多的关注。在大型语言模型与充足训练数据下,提示调优性能可与全模型调优相媲美。然而,在少样本设定下训练样本有限时,提示调优无法匹配全模型微调的性能。本文致力于通过从源任务的软提示迁移知识来提升提示调优的少样本性能。认识到集成方法在低数据体制下的良好泛化能力,我们首先实验并表明,在少样本设定下,基于不同源提示的模型预测的简单集成优于现有的多提示知识迁移方法(如源提示融合)。受此观察启发,我们进一步研究模型集成并提出源模型样本特定集成(SESoM)。SESoM在集成源模型输出时,针对每个目标样本分别学习调整各源模型的贡献。通过这种方式,SESoM继承了模型集成方法的优越泛化能力,同时捕捉了每个源提示的样本特定能力。我们使用不同规模模型(T5-{base, large, XL})在八项多样的NLP任务上开展实验,发现SESoM始终以较大幅度优于同等及更大参数规模的现有模型。
引用
@article{arxiv.2210.12587,
title = {Model ensemble instead of prompt fusion: a sample-specific knowledge transfer method for few-shot prompt tuning},
author = {Xiangyu Peng and Chen Xing and Prafulla Kumar Choubey and Chien-Sheng Wu and Caiming Xiong},
journal= {arXiv preprint arXiv:2210.12587},
year = {2023}
}