中文

Transformer 中涌现的上下文学习的瞬态本质

机器学习 2023-12-13 v3 人工智能 计算与语言

摘要

Transformer 神经网络即使未被显式训练用于上下文学习(ICL),也能展现出惊人的上下文学习能力。先前工作通过机制可解释性、贝叶斯推断或考察训练数据的分布特性等视角,对 ICL 如何在 Transformer 中涌现提供了更深理解。然而,在这些情形中,ICL 很大程度上被视为一种持久现象;即一旦 ICL 涌现,便假定其渐近持久。在此,我们表明 Transformer 训练期间 ICL 的涌现事实上是经常瞬态的。我们在合成数据上训练 Transformer,该数据设计为使 ICL 与权重内学习(IWL)策略均可导致正确预测。我们发现 ICL 先涌现,随后消失并让位于 IWL,而整个过程中训练损失下降,表明对 IWL 的渐近偏好。ICL 的瞬态本质在一系列模型规模与数据集的 Transformer 中被观测到,引发了在寻求紧凑、运行更廉价的模型时应多大程度“过训练”Transformer 的问题。我们发现 L2 正则化可能提供一条实现更持久 ICL 的路径,从而免去基于 ICL 风格验证任务的早停需求。最后,我们给出初步证据,表明 ICL 瞬态可能由 ICL 与 IWL 回路之间的竞争引起。

关键词

引用

@article{arxiv.2311.08360,
  title  = {The Transient Nature of Emergent In-Context Learning in Transformers},
  author = {Aaditya K. Singh and Stephanie C. Y. Chan and Ted Moskovitz and Erin Grant and Andrew M. Saxe and Felix Hill},
  journal= {arXiv preprint arXiv:2311.08360},
  year   = {2023}
}

备注

19 pages, 16 figures