中文

KKANs:Kurkova-Kolmogorov-Arnold 网络及其学习动力学

机器学习 2024-12-24 v1 数值分析 数值分析 机器学习

摘要

灵感来自Kolmogorov-Arnold 表示定理和 Kurkova 使用近似表示的原则,我们提出Kurkova-Kolmogorov-Arnold 网络(KKAN),一种新的两块架构,将基于鲁棒的多层感知器(MLP)的内部函数与作为外部函数的灵活线性组合基函数相结合。我们首先证明了KKAN是通用逼近器,然后展示了其在科学机器学习应用中的多样性,包括函数回归、基于物理的机器学习(PIML),以及算子学习框架。基准结果显示,KKANs 在函数逼近和算子学习任务中优于MLP和原始Kolmogorov-Arnold 网络(KANs),在PIML中达到与完全优化的MLP相当的性能。为了更好地理解新表示模型的行为,我们使用信息瓶颈理论分析其几何复杂性和学习动力学,在所有类型架构中识别出三个通用学习阶段:拟合、过渡和扩散。我们发现几何复杂性与信噪比(SNR)之间存在强相关,在扩散阶段实现最佳泛化。此外,我们提出了自比例残差注意力权重,以动态保持高SNR,确保均匀收敛和延长学习。

关键词

引用

@article{arxiv.2412.16738,
  title  = {KKANs: Kurkova-Kolmogorov-Arnold Networks and Their Learning Dynamics},
  author = {Juan Diego Toscano and Li-Lian Wang and George Em Karniadakis},
  journal= {arXiv preprint arXiv:2412.16738},
  year   = {2024}
}

备注

Kolmogorov-Arnold representation theorem; physics-informed neural networks; Kolmogorov-Arnold networks; optimization algorithms; self-adaptive weights; information bottleneck theory