中文

识别等效训练动力学

机器学习 2024-11-01 v3 人工智能 动力系统

摘要

对深度神经网络(DNN)参数在训练过程中经历的非线性演化的研究,揭示了具有不同动力学行为的机制。虽然对这些现象的详细理解有潜力推动训练效率和鲁棒性的提升,但缺乏识别DNN模型何时具有等效动力学的方法,限制了从先前工作中获得的洞察。拓扑共轭,一个来自动力系统理论的概念,提供了动力学等效性的精确定义,为满足这一需求提供了一条可能的途径。然而,拓扑共轭在历史上一直难以计算。通过利用Koopman算子理论的进展,我们开发了一个用于识别共轭和非共轭训练动力学的框架。为了验证我们的方法,我们证明了比较Koopman特征值可以正确识别在线镜像下降和在线梯度下降之间的已知等效性。然后,我们利用我们的方法来:(a)识别浅层和宽的全连接神经网络之间的非共轭训练动力学;(b)表征卷积神经网络训练动力学的早期阶段;(c)揭示经历和未经历grokking的Transformer中的非共轭训练动力学。我们在多种DNN架构上的结果,说明了我们框架的灵活性,并凸显了其在揭示训练动力学新见解方面的潜力。

关键词

引用

@article{arxiv.2302.09160,
  title  = {Identifying Equivalent Training Dynamics},
  author = {William T. Redman and Juan M. Bello-Rivas and Maria Fonoberova and Ryan Mohr and Ioannis G. Kevrekidis and Igor Mezić},
  journal= {arXiv preprint arXiv:2302.09160},
  year   = {2024}
}

备注

23 pages, 5 figures, 6 supplemental figures