BBTv2:迈向大语言模型的无梯度未来
计算与语言
2022-10-17 v2 人工智能
摘要
大多数下游适配方法通过梯度下降调整预训练模型 (PTMs) 的全部或部分参数,其中调优成本随模型规模增长线性增加。相比之下,无梯度方法仅需 PTM 的前向计算来调整提示,保留了高效调优与部署的优势。然而,以往关于无梯度调优的工作常引入梯度下降以寻找提示的良好初始化,且缺乏跨任务和 PTMs 的通用性。在本文中,我们提出 BBTv2,即黑盒调优 (Black-Box Tuning) 的改进版本,以驱动 PTMs 进行少样本学习。我们将连续提示前置到 PTM 的每一层,并提出一种分而治之的无梯度算法来交替优化不同层的提示。跨多个任务和 PTMs 的大量实验表明,在少样本设定下,BBTv2 能达到与全模型调优及 SOTA 参数高效方法(如 Adapter、LoRA、BitFit 等)相当的性能,同时保持少得多的可调参数。
引用
@article{arxiv.2205.11200,
title = {BBTv2: Towards a Gradient-Free Future with Large Language Models},
author = {Tianxiang Sun and Zhengfu He and Hong Qian and Yunhua Zhou and Xuanjing Huang and Xipeng Qiu},
journal= {arXiv preprint arXiv:2205.11200},
year = {2022}
}
备注
Accepted to EMNLP 2022 (main conference). Code is available at https://github.com/txsun1997/Black-Box-Tuning