扩大神经元,而非参数
机器学习
2025-10-07 v1
摘要
本工作展示了在不增加非零参数数量的情况下增加网络中神经元的数量如何提升性能。我们指出,这一收益与多个特征之间若要共享相同神经元时的干扰减少相吻合。为减少固定非零参数计数下的此类 entanglement,我们引入固定参数扩张(FPE):将一个神经元替换为多个子节点,并在其权重上进行不相交的分割,使得每个子节点继承其连接子集的非重叠子集。在符号任务上,具体为布尔代码问题中,clause 对齐的 FPE 系统性地减少了多义性指标,并产生更高的任务准确率。值得注意的是,随机分配神经元权重可近似这些收益,这表明减少碰撞(而非精确分配)是主要驱动力。与叠加假设一致,FPE 的优势随干扰程度的增加而增大:当多义负荷较大时,准确率改进最大。将这些洞见迁移到实际模型(如对 CLIP 嵌入的分类器和更深的多层网络)时,我们发现,在保持非零参数计数恒定的同时扩宽网络,准确率始终会提高。这些结果识别了一种以可解释性为基础的机制,利用宽度来对抗叠加,从而在不增加非零参数数量的情况下提高性能。这种方向与现代加速器相吻合,其中非零参数的内存移动而非原始计算是主要瓶颈。
引用
@article{arxiv.2510.04500,
title = {Expand Neurons, Not Parameters},
author = {Linghao Kong and Inimai Subramanian and Yonadav Shavit and Micah Adler and Dan Alistarh and Nir Shavit},
journal= {arXiv preprint arXiv:2510.04500},
year = {2025}
}
备注
10 pages, 6 figures