中文

变压器在上下文学习中所致机制的差异性阐述

机器学习 2026-04-15 v1 无序系统与神经网络 统计力学

摘要

现代分布式网络,尤其是变压器,获得了一种突出的能力(称为“in-context learning”),即适应其输入统计量的计算,使得固定网络可应用于来自广泛系统的数据。本文我们对此在训练离散马尔可夫链有限集合 SS 上的变压器提供了完整的机制性表征。变压器显示四个算法阶段,由网络是否记忆和是否泛化以及是否使用 1 点或 2 点统计量决定。我们展示这四个阶段由多层子电路实现,这些子电路体现了两种用于实现上下文自适应计算的质异机制。最小模型孤立了两种动机的关键特征。记忆和泛化阶段由两个边界划分,这些边界取决于数据多样性 K=SK = |S|。第一个(K1K_1^\ast)由子电路间的动力学竞争决定,第二个(K2K_2^\ast)由表示性瓶颈决定。一种受对称性约束的变压器训练动力学理论解释了从 1 点到 2 点泛化的尖锐转变,并识别了允许网络泛化的关键特征。综上所述,我们表明变压器发展出不同的子电路来实现上下文学习,并识别有利于某些机制而非其他机制的条件。

关键词

引用

@article{arxiv.2604.12151,
  title  = {Distinct mechanisms underlying in-context learning in transformers},
  author = {Cole Gibson and Wenping Cui and Gautam Reddy},
  journal= {arXiv preprint arXiv:2604.12151},
  year   = {2026}
}

备注

46 pages, 19 figures