中文

Bug 或 Feature$^2$:权重漂移、激活稀疏与尖峰

机器学习 2026-05-22 v2

摘要

现代神经网络架构的设计通过逐步的经验性选择而趋于一致,但主导其训练动力学的机制仍仅部分被理解。我们识别并分析了由标准损失函数与正偏置激活函数相互作用导致的负权重漂移。我们证明,在均方误差或交叉熵损失下,正预激活相对于的梯度在初始化时为非负,导致后续权重在早期训练中趋向负值。漂移是优化的内在属性,而非数据所致,持续存在于各种架构(MLP、ResNet、ViT、GPT-nano、MP-SENe)和非对称激活函数(ReLU、GELU、SiLU)中。与 ReLU 共同作用,权重漂移可导致 GPT-nano 中的激活稀疏率达到 90%。我们对 79 种配置下的稀疏-精度权衡进行了表征,并识别出在约 70% 激活稀疏率上存在显著的精度临界值。虽然 ReLU2^2 在 GPT-nano 中实现了较好的稀疏-精度比例,但其会病理性放大中间 Transformer 层中的激活尖峰。裁剪可解决此问题,同时保留平方的表征性收益:裁剪后的 ReLU2^2 在性能上优于未裁剪版本,GELU2^2 在 GPT-nano 上实现最低的验证损失。代码已公开于 https://github.com/On-Point-RND/BugOrFeature。

关键词

引用

@article{arxiv.2605.17659,
  title  = {Bug or Feature$^2$: Weight Drift, Activation Sparsity and Spikes},
  author = {Egor Shvetsov and Aleksandr Serkov and Shokorov Viacheslav and Redko Dmitry and Vladislav Goloshchapov and Evgeny Burnaev},
  journal= {arXiv preprint arXiv:2605.17659},
  year   = {2026}
}