特征彩 Lottery?概念涌现的分岔理论
机器学习
2026-05-26 v1 人工智能
摘要
神经网络在训练过程中会在特定时刻获取结构化表示,但通常依赖的判定手段仍依赖于事后、标签依赖的指标。我们引入表示动力学的分岔理论,以实时检测这些转折点。通过分析附着于演化编码器上的被动 GMM 探针,我们展示,结构的启动对应于由损失 Hessian 驱动的超临界分叉。该系统 exhibits 一个理论上可预测的零交叉点(),与网络当前状态()的比值,即 :一种通用、无标签的相位坐标,可完全从隐藏状态中计算得出。我们在 Pythia 语言模型上的稀疏自编码器(SAE)、CIFAR 上的自监督学习(SSL)以及模块算术中的涌现现象中,实证验证了该坐标预测的四种不同转折 regime。关键在于,在有限耗散条件下,宏观对称性破缺可能滞后初始零交叉点数十倍,这为 grokking 中延迟逃逸提供了严格的动力学解释。微观方面,分岔创建共享的不稳定子空间,迫使集体对称性破缺。我们称之为 SAE 训练中的“特征彩 Lottery”:一个特征的终端可解释性在 remarkably early 即可预测。仅通过 5% 的训练,早期原子纯度就能稳健地预测最终收敛纯度,前 10% 的早期原子在收敛时实现超过 12 倍的基线纯度。除解释概念涌现外, 提供了一种实用的早期警报指示器,可在下游指标响应前检测 usable structure 的启动、特征身份的晶体化以及表示崩溃时刻。
引用
@article{arxiv.2605.24057,
title = {Feature Lottery? A Bifurcation Theory of Concept Emergence},
author = {Fuming Yang},
journal= {arXiv preprint arXiv:2605.24057},
year = {2026}
}