Kolmogorov-Arnold 网络上梯度下降的优化、泛化与差分隐私界限
机器学习
2026-05-14 v3 人工智能
机器学习
摘要
Kolmogorov-Arnold 网络(KANs)最近作为标准多层感知器(MLPs)的结构化替代方案,但其训练动力学、泛化及隐私性质的原则性理论仍有限。本文分析了用于训练二维 KANs 的梯度下降(GD),推导了一般界限以刻画其训练动力学、泛化及差分隐私(DP)下的实用性。具体而言,在 NTK 可分离假设下,我们针对 logistic 损失进行分析,表明多对数网络宽度足以使 GD 实现 级的优化速率和 级的泛化速率,其中 为 GD 迭代次数, 为样本量。在隐私设置下,我们 characterize 所需噪声以实现 -DP,并获得 级的效用界限( 为输入维度),与一般凸 Lipschitz 问题的经典下界相匹配。我们的结果表明,多对数宽度不仅充分,而且在差分隐私下也是必要的,揭示了非私有(仅充分性)与私有(必要性也随之而来)训练 regime 之间存在本质差异。实验进一步说明,这些理论洞见可指导实际选择,包括网络宽度和提前停止。
引用
@article{arxiv.2601.22409,
title = {Optimization, Generalization and Differential Privacy Bounds for Gradient Descent on Kolmogorov-Arnold Networks},
author = {Puyu Wang and Junyu Zhou and Philipp Liznerski and Marius Kloft},
journal= {arXiv preprint arXiv:2601.22409},
year = {2026}
}
备注
42 pages, 3 figures