预训练语料库对大规模语言模型上下文学习的影响
计算与语言
2022-05-10 v2
摘要
许多近期关于大规模语言模型的研究报告了成功的上下文零样本和少样本学习能力。然而,关于上下文学习何时发生的深入分析仍然缺乏。例如,随着训练语料库的变化,上下文学习性能如何改变尚属未知。在此,我们研究了预训练语料库的来源与规模对 HyperCLOVA(一个以韩语为中心的 GPT-3 模型)中上下文学习的影响。通过我们的深入调查,我们提出以下观察:(1)上下文学习性能严重依赖于语料领域来源,且预训练语料库的规模不一定决定上下文学习的出现;(2)当一个语言模型在多个语料库组合上训练时,即使每个语料库自身不导致上下文学习,上下文学习能力也可能涌现;(3)使用与下游任务相关的语料进行预训练并不总能保证该下游任务具有竞争力的上下文学习性能,尤其在少样本设定下;(4)语言建模(以困惑度衡量)与上下文学习之间的关系并非总是相关:例如,低困惑度并不总意味着高上下文少样本学习性能。
引用
@article{arxiv.2204.13509,
title = {On the Effect of Pretraining Corpora on In-context Learning by a Large-scale Language Model},
author = {Seongjin Shin and Sang-Woo Lee and Hwijeen Ahn and Sungdong Kim and HyoungSeok Kim and Boseop Kim and Kyunghyun Cho and Gichang Lee and Woomyoung Park and Jung-Woo Ha and Nako Sung},
journal= {arXiv preprint arXiv:2204.13509},
year = {2022}
}
备注
Accepted to NAACL2022 as a long paper. Camera-ready version