面向生成的参数高效学习评估
计算与语言
2022-10-26 v1
摘要
参数高效学习方法(PERMs)近期备受关注,因其为预训练语言模型(PLMs)适配下游任务提供了高效途径。然而,这些结论大多基于全训练集上的域内评估得出。本文从三个新视角对PERMs与微调进行比较:(1)样本量与模型规模对域内评估的影响,(2)对未见领域与新数据集的泛化能力,以及(3)生成内容的忠实度。我们的结果表明,在域内设定下(a)存在一样本量交叉点,当以较少样本训练时PERMs优于微调,且(b)较大的PLMs具有更大的交叉点。对于跨领域与跨数据集情形,我们表明(a)Adapter(Houlsby等,2019)在所研究的全部PERMs中表现最佳,且(b)当任务数据集低于某一规模时其优于微调。我们还比较了生成的忠实度,并显示PERMs可比微调取得更好的忠实度评分,尤其在小型训练集下高出至多6%。最后,我们将Adapter应用于MT-NLG 530b(Smith等,2022),并在Xsum(Narayan等,2018)上以所有ROUGE分数(ROUGE-1 49.17、ROUGE-2 27.20、ROUGE-L 40.98)取得了新的SOTA结果。
引用
@article{arxiv.2210.13673,
title = {Evaluating Parameter Efficient Learning for Generation},
author = {Peng Xu and Mostofa Patwary and Shrimai Prabhumoye and Virginia Adams and Ryan J. Prenger and Wei Ping and Nayeon Lee and Mohammad Shoeybi and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2210.13673},
year = {2022}
}
备注
Accepted to EMNLP 2022 main conference