学习‘懂’:模块算术任务中情境学习与技能组合的出现
机器学习
2024-11-05 v2 无序系统与神经网络
高能物理 - 理论
机器学习
摘要
大型语言模型能够解决训练集中不存在的任务。人们认为,这一能力归因于情境学习和技能组合。本文我们研究模块算术任务中情境学习和技能组合的出现。具体而言,我们考虑一组有限的线性模块函数 ,其由向量 标记。我们使用其中的一些任务进行预训练,其余任务用于超出分布测试。我们经验性地表明,GPT 架构的变压器在预训练任务数量增加时,从分布内到分布外的泛化呈现出一种转变。我们发现,能够实现分布外泛化的最小模型仅需两个变压器块;而对于更深的模型,分布外泛化阶段是\emph{瞬时}的, necessitating early stopping。最后,我们对预训练模型进行可解释性研究,揭示了注意力头和MLP中高度结构化的表示;并讨论了所学算法。值得注意的是,我们发现更深的模型会出现一种算法性的转变,即从少量到大量情境示例之间发生变化。
引用
@article{arxiv.2406.02550,
title = {Learning to grok: Emergence of in-context learning and skill composition in modular arithmetic tasks},
author = {Tianyu He and Darshil Doshi and Aritra Das and Andrey Gromov},
journal= {arXiv preprint arXiv:2406.02550},
year = {2024}
}
备注
Camera-ready version, NeurIPS 2024 (Oral)