中文

叠加玩具模型中的动力学与贝叶斯相变

机器学习 2023-10-11 v1 人工智能

摘要

我们利用奇异学习理论(SLT)研究了叠加玩具模型(TMS)中的相变。我们推导了理论损失的闭式公式,并在两个隐藏维度的情况下发现正则 kk-边形是临界点。我们提出的支撑理论表明,这些 kk-边形的局部学习系数(一种几何不变量)决定了贝叶斯后验作为训练样本量函数的相变。随后我们通过实验证明,相同的 kk-边形临界点也决定了 SGD 训练的行为。由此呈现的图景为以下猜想增添了证据:SGD 学习轨迹受到一种顺序学习机制的支配。具体而言,我们发现 TMS 中的学习过程,无论是通过 SGD 还是贝叶斯学习,都可以刻画为在参数空间中从高通量低复杂度区域向低损失高复杂度区域的旅程。

关键词

引用

@article{arxiv.2310.06301,
  title  = {Dynamical versus Bayesian Phase Transitions in a Toy Model of Superposition},
  author = {Zhongtian Chen and Edmund Lau and Jake Mendel and Susan Wei and Daniel Murfet},
  journal= {arXiv preprint arXiv:2310.06301},
  year   = {2023}
}