迈向理解Grokking:表征学习的有效理论
机器学习
2022-10-17 v2 无序系统与神经网络
统计力学
人工智能
经典物理
摘要
我们旨在理解grokking现象,即模型在过拟合训练集后很久才泛化的现象。我们提出了以有效理论为基础的微观分析,以及描述跨超参数学习性能的相图的宏观分析。我们发现泛化源于结构化表征,其在玩具设定下的训练动态及对训练集大小的依赖可由我们的有效理论预测。我们在经验上观察到四种学习阶段的存在:理解、grokking、记忆与混淆。我们发现表征学习仅发生在记忆与混淆之间的“Goldilocks区”(包括理解与grokking)内。我们在Transformer上发现grokking阶段比理解阶段更靠近记忆阶段,导致延迟泛化。Goldilocks区让人联想到达尔文进化中的“匮乏催生的智能”,即资源限制驱动对更高效方案的发现。本研究不仅提供了grokking起源的直观解释,也凸显了受物理学启发工具(如有效理论与相图)对于理解深度学习的用处。
引用
@article{arxiv.2205.10343,
title = {Towards Understanding Grokking: An Effective Theory of Representation Learning},
author = {Ziming Liu and Ouail Kitouni and Niklas Nolte and Eric J. Michaud and Max Tegmark and Mike Williams},
journal= {arXiv preprint arXiv:2205.10343},
year = {2022}
}
备注
Accepted by NeurIPS 2022