中文

Sprecher 网络:参数高效的Kolmogorov-Arnold架构

机器学习 2026-01-27 v2 人工智能 数值分析 数值分析

摘要

我们提出Sprecher网络(SNs),这是一族源自David Sprecher于1965年提出的Kolmogorov-Arnold表示法可构造形式的可训练架构。每个SN模块实现“单变量函数之和偏移形式”,仅需两个共享可学习样条函数:一个单调内样条ϕ\phi和一个通用外样条Φ\Phi,外加一个可学习的平移参数η\eta和一个在所有输出维度上共享的混合向量λ\lambda。叠加这些模块可构成深层、可组合的模型;对于向量输出,可追加额外的非求和输出模块。我们还提出了可选的横向混合算子,使输出通道之间在模块内进行通信,仅需O(doutput)O(d_{\mathrm{output}})个额外参数。由于采用向量(而非矩阵)混合权重和样条共享,SNs在宽度上的线性扩展尤为吸引人,对于GG个样条节点,参数量约为O((d1+d+G))O(\sum_{\ell}(d_{\ell-1}+d_{\ell}+G)),相较于密集MLP的O(d1d)O(\sum_{\ell} d_{\ell-1}d_{\ell})以及边缘样条KAN的O(Gd1d)O(G\sum_{\ell} d_{\ell-1}d_{\ell})具有显著优势。这种线性宽度扩展尤其适用于极宽、浅模型,浅层可转化为低推理延迟。最后,我们描述了一种顺序前向实现,避免构建din×doutd_{\mathrm{in}}\times d_{\mathrm{out}}的偏移输入张量,将峰值前向中间内存从二次降低到与层宽度成线性相关,适用于内存受限环境如设备端/边缘推理;我们通过在仅需4 MB RAM的资源受限嵌入式设备上进行固定点实时数字分类,展示了可部署性。我们在监督回归、Fashion-MNIST分类(包括25层残差连接和归一化下的稳定训练)以及泊松PINN方面提供了实证演示,并与MLP和KAN基线进行了受控比较。

关键词

引用

@article{arxiv.2512.19367,
  title  = {Sprecher Networks: A Parameter-Efficient Kolmogorov-Arnold Architecture},
  author = {Christian Hägg and Kathlén Kohn and Giovanni Luca Marchetti and Boris Shapiro},
  journal= {arXiv preprint arXiv:2512.19367},
  year   = {2026}
}

备注

45 pages