探索模型缩放对参数高效微调的影响
计算与语言
2023-12-19 v2 人工智能
摘要
参数高效微调(PET)方法仅训练极少量参数即可有效驱动超大规模预训练语言模型(PLM)。不同的 PET 方法利用不同人工设计的可调模块。在小型 PLM 中,PET 方法之间通常存在明显的性能差异。然而,随着模型规模增大,性能差异变得微小。因此,我们假设模型缩放缓解了设计差异对 PET 方法的影响。为验证该假设,我们引入一种更灵活的 PET 方法,称为任意 PET(APET)方法。APET 方法兼容由任意数量、分布于任意位置的可调参数组成的模块。随后,我们利用该方法在 3 个代表性 PLM 上的 11 个 NLP 任务中开展实验。我们的研究揭示,模型缩放(1)缓解了可调参数位置对性能的影响,(2)使微调方法通过优化更少的可调参数即可达到与全参数微调相当的性能。有趣的是,我们还观察到,在不同任务上微调方法优化相似数量的可调参数即可超越随机猜测性能。我们从优化视角共同讨论了该现象与上述两点发现,以理解底层机制。这些结论增进了我们对模型缩放影响 PET 的理解,并有助于为不同规模的 PLM 设计更高效且有效的 PET 方法。源代码可从该 GitHub 仓库获取:\url{https://github.com/yushengsu-thu/PET_Scaling}。
引用
@article{arxiv.2306.02320,
title = {Exploring the Impact of Model Scaling on Parameter-Efficient Tuning},
author = {Yusheng Su and Chi-Min Chan and Jiali Cheng and Yujia Qin and Yankai Lin and Shengding Hu and Zonghan Yang and Ning Ding and Xingzhi Sun and Guotong Xie and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2306.02320},
year = {2023}
}