缩减规模生成式语言模型中的涌现能力
计算与语言
2024-04-04 v1 机器学习
摘要
大语言模型无需特定任务的微调即可解决新任务。这种能力也被称为上下文学习(ICL),被认为是一种涌现能力,主要见于具有数十亿参数的大语言模型中。本研究调查这种涌现特性是否严格与模型规模绑定,或者能否由在缩减规模数据上训练的更小模型所展现。为了探索这一点,我们简化预训练数据,并预训练了 36 个因果语言模型,参数量从 100 万到 1.65 亿不等。我们表明,在这种简化预训练数据上训练的模型在简化语言的各种任务中展现出增强的零样本能力,在无限制语言上取得了比其大六倍的预训练模型相当的性能。这表明,缩减语言规模允许零样本学习能力在有限规模的模型中涌现。此外,我们发现这些在简化数据上预训练的较小模型在评估损失与三个缩放因子(计算量、数据集大小和模型大小)之间表现出幂律关系。
引用
@article{arxiv.2404.02204,
title = {Emergent Abilities in Reduced-Scale Generative Language Models},
author = {Sherin Muckatira and Vijeta Deshpande and Vladislav Lialin and Anna Rumshisky},
journal= {arXiv preprint arXiv:2404.02204},
year = {2024}
}
备注
16 pages, 4 figures. Accepted to NAACL 2024 Findings