中文

当梯度下降遇见无导数优化:黑盒场景下的天作之合

计算与语言 2023-05-18 v1 人工智能

摘要

大型预训练语言模型(PLM)因其在解决广泛自然语言处理(NLP)任务中的通用性与潜力而备受关注。然而,运行这些 PLM 的成本可能高得令人望而却步。此外,出于商业考量与滥用风险(如 GPT-3),PLM 可能不予开源。在此场景下,PLM 的参数与梯度均不可得。为解决该问题,已有研究提出黑盒微调,其利用无导数优化(DFO)而非梯度下降来训练任务特定的连续提示。然而,这些无梯度方法仍与基于梯度的方法存在显著差距。本文通过知识蒸馏将梯度下降引入黑盒微调场景。进一步地,我们提出一种新方法 GDFO,其以协调方式整合梯度下降与无导数优化以优化任务特定的连续提示。实验结果表明,GDFO 相较先前最先进的方法取得了显著的性能提升。

关键词

引用

@article{arxiv.2305.10013,
  title  = {When Gradient Descent Meets Derivative-Free Optimization: A Match Made in Black-Box Scenario},
  author = {Chengcheng Han and Liqing Cui and Renyu Zhu and Jianing Wang and Nuo Chen and Qiushi Sun and Xiang Li and Ming Gao},
  journal= {arXiv preprint arXiv:2305.10013},
  year   = {2023}
}