中文

通过“稳定边缘”学习阈值神经元

机器学习 2023-10-20 v2 人工智能 最优化与控制

摘要

现有的神经网络训练分析通常在极小学习率的不现实假设下进行。这与实践经验和实证研究(如 J. Cohen 等人(ICLR 2021)的工作)形成鲜明对比,后者展示了惊人的新现象(“稳定边缘”或“不稳定收敛”)以及大学习率机制下对泛化的潜在益处。尽管近期有大量相关工作,后一效应仍知之甚少。在本文中,我们通过对两层神经网络简化模型的梯度下降进行详细分析,向理解具有大学习率的真正非凸训练动力学迈出一步。对于这些模型,我们可证明地确立了稳定边缘现象,并发现了步长的尖锐相变:低于该步长时,神经网络无法学习“类阈值”神经元(即具有非零第一层偏置的神经元)。这阐明了一个可能的机制,借此稳定边缘实际上可带来更好的泛化,因为阈值神经元是具有有用归纳偏置的基本构建块,适用于许多任务。

关键词

引用

@article{arxiv.2212.07469,
  title  = {Learning threshold neurons via the "edge of stability"},
  author = {Kwangjun Ahn and Sébastien Bubeck and Sinho Chewi and Yin Tat Lee and Felipe Suarez and Yi Zhang},
  journal= {arXiv preprint arXiv:2212.07469},
  year   = {2023}
}

备注

31 pages, 13 figures, Published at NeurIPS 2023