使预训练语言模型成为更优的小样本学习器
计算与语言
2021-06-03 v2 机器学习
摘要
近期的 GPT-3 模型(Brown 等人,2020)仅利用自然语言提示和少量任务示例作为输入上下文,便取得了显著的小样本性能。受其发现的启发,我们在一个更实际的场景中研究小样本学习,其中我们使用较小的语言模型,对其微调在计算上是高效的。我们提出 LM-BFF——语言模型的更优小样本微调——一套用于在少量标注样本上微调语言模型的简单且互补的技术。我们的方法包括(1)基于提示的微调以及用于自动生成提示的新流程;以及(2)一种将示例动态且选择性地纳入每个上下文的改进策略。最后,我们给出系统性的评估,用于分析在一系列 NLP 任务(包括分类与回归)上的小样本性能。我们的实验表明,在低资源设定下,我们的方法相结合大幅优于标准微调流程,取得了高达 30% 的绝对提升,以及所有任务上平均 11% 的提升。我们的方法对任务资源与领域专业知识做出最小假设,因而构成了一种强任务无关的小样本学习方法。
引用
@article{arxiv.2012.15723,
title = {Making Pre-trained Language Models Better Few-shot Learners},
author = {Tianyu Gao and Adam Fisch and Danqi Chen},
journal= {arXiv preprint arXiv:2012.15723},
year = {2021}
}
备注
Accepted to ACL 2021. The code is publicly available at https://github.com/princeton-nlp/LM-BFF