中文

LiST:轻量提示自训练打造参数高效的少样本学习器

计算与语言 2022-05-20 v2

摘要

我们提出一种新方法 LiST(Lite Prompted Self-Training 的缩写),用于对大型预训练语言模型(PLM)进行参数高效的微调,以用于少样本学习。LiST 通过两项关键技术改进了近期采用基于提示的微调(FN)的方法。其一是使用自训练在少样本场景下利用大量无标注数据用于基于提示的 FN。我们将自训练与元学习结合以对带噪伪提示标签重新加权。自训练成本高昂,因为它需要反复更新所有模型参数。因此,我们使用第二项轻量微调技术,引入少量任务特定参数,在自训练期间对其进行微调,同时保持 PLM 编码器冻结。我们的实验表明,LiST 能有效利用无标注数据提升少样本学习的模型性能。此外,微调是高效的,因为它仅更新很小比例的参数,并且由于多个任务可共享一个通用 PLM 编码器作为主干,整体模型占用得以缩减。在六个自然语言理解(NLU)任务上的综合研究表明,当每个任务仅使用不超过 30 个标注样本微调时,LiST 较经典微调提升 35%,较基于提示的 FN 提升 6%,且可训练参数数量减少 96%。凭借仅 14M 可调参数,LiST 在少样本 NLU 任务上以 33% 的优势超越 GPT-3 的上下文学习。

关键词

引用

@article{arxiv.2110.06274,
  title  = {LiST: Lite Prompted Self-training Makes Parameter-Efficient Few-shot Learners},
  author = {Yaqing Wang and Subhabrata Mukherjee and Xiaodong Liu and Jing Gao and Ahmed Hassan Awadallah and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2110.06274},
  year   = {2022}
}

备注

Accepted by NAACL findings. Code is https://github.com/microsoft/LiST