为柯克莫尔-阿尔诺网络进行多层训练
机器学习
2026-03-06 v1 人工智能
数值分析
数值分析
摘要
训练常见神经网络架构的算法加速受限于缺乏函数组合所固有的结构。与多层感知机(MLP)不同,柯克莫尔-阿尔诺网络(Kolmogorov-Arnold Networks, KANs)通过在指定基底中展开所学习的激活函数来提供更结构化的特征。本文利用该结构性质发展出实用的算法和理论见解,实现通过多层训练提升 KANs 的训练速度。为此,我们首先在 KANs 采用样条基函数与以幂 ReLU 激活函数的多通道 MLP 之间建立等价性,通过线性基变换实现。随后,我们分析该基变换对基于梯度的优化几何的影响。KANs 的基变换激发了一种多层训练方法,即通过对样条节点进行均匀细化,自然定义通过解析几何插值算子在模型之间的 KANs 序列。该插值方案使架构形成“properly nested hierarchy”,确保细模型上的优化进度在粗模型上得到保留;同时,样条基函数的紧支撑确保后续层次上的互补优化。数值实验表明,我们的多层训练方法可实现对可比 KANs 或 MLP 的准确性提升数个数量级,尤其在物理信息神经网络方面效果显著。最后,本工作表明,原则性的神经网络设计可导致可被利用的结构,从而发展出可显著提升训练性能的多层算法。
关键词
引用
@article{arxiv.2603.04827,
title = {Multilevel Training for Kolmogorov Arnold Networks},
author = {Ben S. Southworth and Jonas A. Actor and Graham Harper and Eric C. Cyr},
journal= {arXiv preprint arXiv:2603.04827},
year = {2026}
}