中文

稀疏神经网络的脑网络科学建模使 Transformer 和 LLM 能够实现完全连接

机器学习 2026-01-14 v4

摘要

动态稀疏训练(DST)可减少人工神经网络的计算需求,但在保持高稀疏度下的峰值性能方面面临困难。Cannistraci-Hebb 训练(CHT)是一种受脑干瞄准的 Growing 连接方法。CHT 利用梯度无关、拓扑驱动的链路复生,已在各种任务上显示出超稀疏(小于1% 连接)优势,优于完全连接网络。然而,CHT 存在两个主要缺点:(i) 其时间复杂性为 O(Nd3)O(Nd^3)——N 为节点网络大小,d 为节点度——限制其仅适用于超稀疏范式。(ii) 它选择 top 链接预测得分,这不适用于网络呈现不可靠连接的早期训练时段。本文设计了第一个受脑干瞄准的网络模型——称为二分 receptive field(BRF)——用于初始化稀疏人工神经网络的连接。我们进一步引入了 CH 链接预测的 GPU 友好矩阵近似,将复杂性降低到 O(N3)O(N^3)。我们引入了 Cannistraci-Hebb 训练软性规则(CHTs),采用灵活的策略在链路移除和复生中进行采样,平衡网络拓扑的探索与开发。此外,我们将 CHTs 与 sigmoid 渐进密度衰减(CHTss)集成。实验结果表明,BRF 在先前网络科学模型中提供了性能优势。使用1% 的连接,CHTs 在图像分类任务上优于完全连接网络,压缩部分网络至少于30%的节点。使用5% 的连接,CHTss 在两个基于 Transformer 的机器翻译任务中优于完全连接网络。最后,在30% 连接下,CHTs 和 CHTss 在语言建模任务中均优于其他 DST 方法。

关键词

引用

@article{arxiv.2501.19107,
  title  = {Brain network science modelling of sparse neural networks enables Transformers and LLMs to perform as fully connected},
  author = {Yingtao Zhang and Diego Cerretti and Jialin Zhao and Wenjing Wu and Ziheng Liao and Umberto Michieli and Carlo Vittorio Cannistraci},
  journal= {arXiv preprint arXiv:2501.19107},
  year   = {2026}
}