中文

少样本参数高效微调优于且廉于上下文学习

机器学习 2022-08-29 v2 人工智能 计算与语言

摘要

少样本上下文学习(ICL)通过输入少量训练样本作为模型输入的一部分,使预训练语言模型能够在无需任何基于梯度的训练的情况下执行此前未见过的任务。ICL 会带来可观的计算、内存与存储开销,因为它在每次进行预测时都要处理所有训练样本。参数高效微调(PEFT)(例如适配器模块、提示微调、稀疏更新方法等)提供了一种替代范式,即训练一小部分参数以使模型执行新任务。本文中,我们严谨地比较了少样本 ICL 与 PEFT,并证明后者在提供更高准确率的同时大幅降低了计算成本。在此过程中,我们引入了一种称为 (IA)3^3 的新 PEFT 方法,该方法通过学习向量对激活值进行缩放,在仅引入相对极少新参数的同时获得更强的性能。我们还提出了一种基于 T0 模型、称为 T-Few 的简单方案,可应用于新任务而无需任务特定的调优或修改。我们将 T-Few 应用于 RAFT 基准以在完全未见过的任务上验证其有效性,首次达到超越人类的表现,并以 6% 的绝对优势超越最先进水平。我们实验中所用的全部代码均已公开。

关键词

引用

@article{arxiv.2205.05638,
  title  = {Few-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than In-Context Learning},
  author = {Haokun Liu and Derek Tam and Mohammed Muqeeth and Jay Mohta and Tenghao Huang and Mohit Bansal and Colin Raffel},
  journal= {arXiv preprint arXiv:2205.05638},
  year   = {2022}
}