作为结构推断的Grokking:Transformer需要贝叶斯彩票票券
机器学习
2026-05-18 v1 人工智能
摘要
为什么一个已经记住了其训练集的Transformer要等待数千步才开始泛化?现有的解释将这种延迟归因于范数最小化、特征涌现或稀疏子网络的后期发现。这些解释捕捉到了转变的重要部分,但忽略了一个基于注意力机制的模型所独有的约束:如果注意力丢弃了一个信息性词元,那么任何有界的下游计算都无法将其恢复。我们将注意力形式化为任务依赖图上的隐式贝叶斯后验,并证明泛化需要两个可分离的条件:一个是关于MLP容量的熟悉的“金发姑娘”界限,这与基于范数的Grokking理论相符;另一个是新颖的贝叶斯结构条件,要求注意力在每个信息性词元上放置足够的质量。这种解耦将延迟泛化解释为延迟的结构推断。在训练早期,MLP通过未对齐的特征进行记忆,将交叉熵损失驱动至接近零,从而使注意力缺乏结构梯度。然后,权重衰减必须侵蚀记忆,缺失的图才能变得可学习,从而产生了已知的逆权重衰减延迟,我们将其推导为结构等待时间。我们随后证明,这种“解释消除”延迟可以通过基于KL散度的结构干预来绕过,从而为Grokking时间导出了一个逆干预强度缩放定律。在算法序列任务上的实验将结构与容量隔离开来,并表明这种贝叶斯票券匹配或优于彩票票券迁移。
引用
@article{arxiv.2605.15787,
title = {Grokking as Structural Inference: Transformers Need Bayesian Lottery Tickets},
author = {Kai Hidajat and Solden Stoll and Joseph An},
journal= {arXiv preprint arXiv:2605.15787},
year = {2026}
}