中文

语言模型是少样本学习者

计算与语言 2020-07-24 v4

摘要

近期研究表明,通过在大型文本语料上预训练再在特定任务上微调,可在许多 NLP 任务与基准上获得显著提升。尽管该方法在架构上通常与任务无关,仍需要包含数千或数万样例的任务特定微调数据集。相比之下,人类通常仅从少量样例或简单指令即可完成新的语言任务——这是当前 NLP 系统在很大程度上仍难以做到的。本文表明,扩大语言模型规模可大幅改善与任务无关的少样本性能,有时甚至可与先前最先进的微调方法相竞争。具体而言,我们训练了 GPT-3,一个拥有 1750 亿参数的自回归语言模型,比此前任何非稀疏语言模型多 10 倍,并测试其在少样本设定下的表现。对于所有任务,GPT-3 均未使用任何梯度更新或微调,任务与少样本示范仅通过与该模型的文本交互来指定。GPT-3 在许多 NLP 数据集上取得强劲表现,包括翻译、问答与完形填空任务,以及若干需要即时推理或领域适应的任务,如重排单词、在句子中使用新词或执行三位数算术。同时,我们也识别出一些 GPT-3 少样本学习仍吃力的数据集,以及一些 GPT-3 因在大型网络语料上训练而面临方法学问题的数据集。最后,我们发现 GPT-3 可生成新闻文章样本,人类评估者难以将其与人工撰写的文章区分。我们讨论了该发现及 GPT-3 总体的更广泛社会影响。

关键词

引用

@article{arxiv.2005.14165,
  title  = {Language Models are Few-Shot Learners},
  author = {Tom B. Brown and Benjamin Mann and Nick Ryder and Melanie Subbiah and Jared Kaplan and Prafulla Dhariwal and Arvind Neelakantan and Pranav Shyam and Girish Sastry and Amanda Askell and Sandhini Agarwal and Ariel Herbert-Voss and Gretchen Krueger and Tom Henighan and Rewon Child and Aditya Ramesh and Daniel M. Ziegler and Jeffrey Wu and Clemens Winter and Christopher Hesse and Mark Chen and Eric Sigler and Mateusz Litwin and Scott Gray and Benjamin Chess and Jack Clark and Christopher Berner and Sam McCandlish and Alec Radford and Ilya Sutskever and Dario Amodei},
  journal= {arXiv preprint arXiv:2005.14165},
  year   = {2020}
}

备注

40+32 pages