中文

连接 NTK 与 NNGP:宽神经网络学习动力学的统一理论框架

机器学习 2025-05-09 v3 无序系统与神经网络 人工智能

摘要

人工神经网络近年来革新了机器学习,但其学习过程的完整理论框架仍显欠缺。在宽网络中,基于两个不同理论框架取得了实质性进展:神经切线核(NTK,假设线性化梯度下降动力学)与贝叶斯神经网络高斯过程(NNGP)。我们通过在宽深度网络集成中引入带附加噪声的梯度下降学习,统一了这两种理论。我们构建了网络输入输出函数的解析理论,并引入了新的时间依赖神经动力学核(NDK),NTK 与 NNGP 核均可由其导出。我们识别出两个学习阶段:由梯度驱动的学习阶段,以损失最小化为支配,其时间尺度由初始化方差决定;随后是缓慢的扩散学习阶段,参数对解空间进行采样,其时间常数由噪声与贝叶斯先验方差决定。这两个方差参数强烈影响两机制下的性能,尤其在 sigmoid 神经元中。与初始阶段均值预测子的指数收敛不同,到平衡的收敛更为复杂且可能非单调。通过刻画扩散阶段,我们的工作阐明了大脑中的表征漂移,解释了神经活动如何持续变化而不降低性能——或通过使不同突触漂移同步的持续性梯度信号,或通过生成对抗漂移过程鲁棒的任务相关信息的架构偏置。本工作弥合了 NTK 与 NNGP 理论间的鸿沟,为深度宽神经网络的学习过程及生物回路动力学分析提供了全面框架。

关键词

引用

@article{arxiv.2309.04522,
  title  = {Connecting NTK and NNGP: A Unified Theoretical Framework for Wide Neural Network Learning Dynamics},
  author = {Yehonatan Avidan and Qianyi Li and Haim Sompolinsky},
  journal= {arXiv preprint arXiv:2309.04522},
  year   = {2025}
}