中文

学习‘懂’:模块算术任务中情境学习与技能组合的出现

机器学习 2024-11-05 v2 无序系统与神经网络 高能物理 - 理论 机器学习

摘要

大型语言模型能够解决训练集中不存在的任务。人们认为,这一能力归因于情境学习和技能组合。本文我们研究模块算术任务中情境学习和技能组合的出现。具体而言,我们考虑一组有限的线性模块函数 z=ax+by  mod  pz = a \, x + b \, y \;\mathrm{mod}\; p,其由向量 (a,b)Zp2(a, b) \in \mathbb{Z}_p^2 标记。我们使用其中的一些任务进行预训练,其余任务用于超出分布测试。我们经验性地表明,GPT 架构的变压器在预训练任务数量增加时,从分布内到分布外的泛化呈现出一种转变。我们发现,能够实现分布外泛化的最小模型仅需两个变压器块;而对于更深的模型,分布外泛化阶段是\emph{瞬时}的, necessitating early stopping。最后,我们对预训练模型进行可解释性研究,揭示了注意力头和MLP中高度结构化的表示;并讨论了所学算法。值得注意的是,我们发现更深的模型会出现一种算法性的转变,即从少量到大量情境示例之间发生变化。

关键词

引用

@article{arxiv.2406.02550,
  title  = {Learning to grok: Emergence of in-context learning and skill composition in modular arithmetic tasks},
  author = {Tianyu He and Darshil Doshi and Aritra Das and Andrey Gromov},
  journal= {arXiv preprint arXiv:2406.02550},
  year   = {2024}
}

备注

Camera-ready version, NeurIPS 2024 (Oral)