中文

统一 Grokking 与双下降

机器学习 2023-03-14 v1 人工智能

摘要

对深度学习中泛化的原则性理解可能需要将不同的观测统一在单一概念框架下。先前工作研究了\emph{grokking}(一种训练动态,其中持续一段时间的近乎完美的训练性能和近乎随机的测试性能最终随之泛化)以及表面相似的\emph{双下降}(double descent)。这些主题迄今被孤立研究。我们假设 grokking 与双下降可在模式学习速度框架内理解为同一学习动态的实例。我们提出该框架同样适用于改变模型容量而非优化步数的情形,并首次展示了模型层面的 grokking。

关键词

引用

@article{arxiv.2303.06173,
  title  = {Unifying Grokking and Double Descent},
  author = {Xander Davies and Lauro Langosco and David Krueger},
  journal= {arXiv preprint arXiv:2303.06173},
  year   = {2023}
}

备注

ML Safety Workshop, 36th Conference on Neural Information Processing Systems (NeurIPS 2022)