变压器在上下文学习中所致机制的差异性阐述
机器学习
2026-04-15 v1 无序系统与神经网络
统计力学
摘要
现代分布式网络,尤其是变压器,获得了一种突出的能力(称为“in-context learning”),即适应其输入统计量的计算,使得固定网络可应用于来自广泛系统的数据。本文我们对此在训练离散马尔可夫链有限集合 上的变压器提供了完整的机制性表征。变压器显示四个算法阶段,由网络是否记忆和是否泛化以及是否使用 1 点或 2 点统计量决定。我们展示这四个阶段由多层子电路实现,这些子电路体现了两种用于实现上下文自适应计算的质异机制。最小模型孤立了两种动机的关键特征。记忆和泛化阶段由两个边界划分,这些边界取决于数据多样性 。第一个()由子电路间的动力学竞争决定,第二个()由表示性瓶颈决定。一种受对称性约束的变压器训练动力学理论解释了从 1 点到 2 点泛化的尖锐转变,并识别了允许网络泛化的关键特征。综上所述,我们表明变压器发展出不同的子电路来实现上下文学习,并识别有利于某些机制而非其他机制的条件。
引用
@article{arxiv.2604.12151,
title = {Distinct mechanisms underlying in-context learning in transformers},
author = {Cole Gibson and Wenping Cui and Gautam Reddy},
journal= {arXiv preprint arXiv:2604.12151},
year = {2026}
}
备注
46 pages, 19 figures