中文

深度网络线性区域的训练动态

机器学习 2023-10-23 v1 人工智能 计算机视觉与模式识别

摘要

深度网络(DN)训练动态的研究主要聚焦于损失函数在训练与测试集数据点处或其附近的演化。事实上,许多 DN 现象最初在文献中即由此引入,例如双下降、顿悟(grokking)。在本研究中,我们考察由连续分段仿射 DN(如带有(带泄漏)ReLU 非线性的网络)所形成的输入空间划分或线性区域的训练动态。首先,我们提出一种新颖统计量,其基于数据点任意维邻域内线性区域的集中程度来涵盖 DN 的局部复杂度(LC)。我们观察到,在训练期间,数据点周围的 LC 经历若干阶段:初始化后先呈下降趋势,继以上升,最终以再次下降收尾。利用精确可视化方法,我们遇到一个令人困惑的观察:在训练的最终 LC 下降阶段,线性区域从训练与测试样本迁移至决策边界,使 DN 输入输出在其他各处近乎线性。我们还观察到不同的 LC 阶段与 DN 的记忆与泛化性能密切相关,尤其在顿悟期间。

关键词

引用

@article{arxiv.2310.12977,
  title  = {Training Dynamics of Deep Network Linear Regions},
  author = {Ahmed Imtiaz Humayun and Randall Balestriero and Richard Baraniuk},
  journal= {arXiv preprint arXiv:2310.12977},
  year   = {2023}
}

备注

14 pages, 14 figures