中文

关于Kolmogorov--Arnold网络(Arnold网络)的(随机)梯度下降收敛性

机器学习 2024-10-11 v1 人工智能 最优化与控制

摘要

Kolmogorov--Arnold网络(KANs)是一种最近提出的神经网络架构,由于其作为多层感知器(Multilayer Perceptrons, MLPs)的可行替代方案及其对各种科学任务的广泛适用性,已在深度学习领域获得显著关注。经验调查表明,通过随机梯度下降(SGD)优化的KANs能够在各种机器学习任务(如回归、分类和时间序列预测等)以及科学任务(如求解偏微分方程)中实现接近零的训练损失。在本文中,我们通过对二维KANs在求解回归和物理信息化任务中的梯度下降(GD)和SGD进行严格的收敛分析,提供了对经验成功的理论解释。对于回归问题,我们利用神经切线核视角证明,当KANs的隐层维度足够大时,GD可实现目标函数的全局线性收敛。我们进一步将这些结果扩展到SGD,表明在期望意义上也能实现类似的全局收敛。此外,我们分析了GD和SGD在物理信息化KANs上的全局收敛性,这揭示了由于更复杂的损失结构带来的额外挑战。这项工作是首个为GD和SGD应用于优化KANs和物理信息化KANs提供全局收敛保证的工作。

关键词

引用

@article{arxiv.2410.08041,
  title  = {On the Convergence of (Stochastic) Gradient Descent for Kolmogorov--Arnold Networks},
  author = {Yihang Gao and Vincent Y. F. Tan},
  journal= {arXiv preprint arXiv:2410.08041},
  year   = {2024}
}