预训练语言模型的黑盒提示学习
计算与语言
2023-02-24 v3
摘要
通用预训练语言模型(PLMs)规模不断增长,亟需研究跨不同下游任务更高效的适配方法。在本文中,我们建立了黑盒离散提示学习(BDPL)以呼应云基础设施与边缘设备之间的务实交互。具体而言,我们不在云端微调模型,而是通过提示学习来适配 PLMs,该方法仅高效优化离散提示的少数参数。此外,我们考虑了无法访问预训练模型的参数和梯度、仅能获取其给定输入后输出的场景。这种黑盒设置保护了云基础设施免受潜在攻击和误用以导致单点故障,相较于当前基础设施所用的白盒方式更具优势。在此黑盒约束下,我们应用方差缩减策略梯度算法来估计每个离散提示的类别分布中参数的梯度。基于我们的方法,用户设备可通过查询限定在一定数量的 API 调用范围内的 PLMs 来高效调优其任务。我们在 RoBERTa 和 GPT-3 上的实验表明,所提算法以云-设备协作方式在八个基准上取得显著提升。最后,我们进行了深入的案例研究,从各种数据规模、提示长度、训练预算、优化目标、提示可迁移性以及所学提示的可解释性等方面全面分析我们的方法。我们的代码将发布于 https://github.com/shizhediao/Black-Box-Prompt-Learning。
引用
@article{arxiv.2201.08531,
title = {Black-box Prompt Learning for Pre-trained Language Models},
author = {Shizhe Diao and Zhichao Huang and Ruijia Xu and Xuechun Li and Yong Lin and Xiao Zhou and Tong Zhang},
journal= {arXiv preprint arXiv:2201.08531},
year = {2023}
}
备注
To appear in the Transactions on Machine Learning Research (TMLR)