MLP的离散魅力:Transformer前馈层中连续信号的二进制路由
机器学习
2026-03-12 v1
摘要
我们表明,Transformer语言模型中的MLP层执行连续信号的二进制路由:是否需要对token进行非线性处理的决策,被二进制神经元激活良好地捕获,尽管被路由的信号是连续的。在GPT-2 Small(1.24亿参数)中,我们发现特定神经元实现一种共识架构——七个“默认打开”神经元和一个例外处理器(Layer 11中的N2123),它们93-98%互斥,从而创建二进制路由开关。跨层分析揭示了一种发展轨迹:早期层(L1-3)使用单个网关神经元对异常进行路由,而无需共识投票;中期层(L4-6)显示分散的处理,既无网关也无共识;晚期层(L7-11)逐渞形成完整的共识/例外架构,投票规模递增(1到3到7个共识神经元)。因果验证确认该路由具有功能性:在共识崩溃时移除MLP会导致困惑度下降43.3%,而在完全共识时仅下降10.1%——差距超过4倍。比较二进制与连续特征用于路由决策,确认二值化几乎未丢失信息(79.2% vs 78.8%准确率),而连续激活携带额外的幅度信息(R^2 = 0.36 vs 0.22)。这种二进制路由结构解释了为何光滑多项式逼近失败:交叉验证的多项式拟合(次数2-7)从未超过R^2 = 0.06。我们提出,深层网络的已建立分片仿射特征描述可以补充一种路由描述:沿自然数据流形,分片边界实现关于哪些token需要非线性处理的二进制决策,将连续信号路由到不同于其他token的计算路径中。
关键词
引用
@article{arxiv.2603.10985,
title = {The Discrete Charm of the MLP: Binary Routing of Continuous Signals in Transformer Feed-Forward Layers},
author = {Peter Balogh},
journal= {arXiv preprint arXiv:2603.10985},
year = {2026}
}