更大规模语言模型以不同方式进行上下文学习
计算与语言
2023-03-09 v2
摘要
我们研究语言模型中的上下文学习(ICL)如何受到语义先验与输入-标签映射的影响。我们在多种模型族(GPT-3、InstructGPT、Codex、PaLM 和 Flan-PaLM)上考察了两种设定——翻转标签的 ICL 与语义无关标签的 ICL。首先,关于翻转标签 ICL 的实验表明,覆盖语义先验是模型规模的一种涌现能力。小型语言模型忽略上下文中给出的翻转标签,因而主要依赖预训练得到的语义先验;而大型模型即便持有更强的语义先验,在给定与先验矛盾的上下文示例时,也能覆盖语义先验。我们接着研究语义无关标签 ICL(SUL-ICL),其中标签与其输入在语义上无关(例如用 foo/bar 代替 negative/positive),从而迫使语言模型学习上下文示例中所展示的输入-标签映射以完成任务。进行 SUL-ICL 的能力也主要随规模涌现,且足够大的语言模型甚至能在 SUL-ICL 设定下执行线性分类。最后,我们评估了指令微调模型,发现指令微调同时增强了语义先验的使用与输入-标签映射的学习能力,但前者增强得更多。
引用
@article{arxiv.2303.03846,
title = {Larger language models do in-context learning differently},
author = {Jerry Wei and Jason Wei and Yi Tay and Dustin Tran and Albert Webson and Yifeng Lu and Xinyun Chen and Hanxiao Liu and Da Huang and Denny Zhou and Tengyu Ma},
journal= {arXiv preprint arXiv:2303.03846},
year = {2023}
}