中文

超越神经网络的 Grokking:基于模型复杂度的实证探索

机器学习 2024-04-02 v2 机器学习

摘要

在某些设定下,神经网络表现出一种称为 \textit{grokking} 的现象,即在训练集上达到相同性能很久之后,其在验证集上才实现完美或近完美精度。本文中,我们发现 grokking 并不限于神经网络,而是出现在其他设定中,如高斯过程(GP)分类、GP 回归、线性回归与贝叶斯神经网络。我们还揭示了一种通过添加含伪信息维度在算法数据集上诱导 grokking 的机制。该现象在非神经架构中的存在表明,grokking 并不限于当前理论与实证研究所考虑的设定。相反,grokking 可能出现在任何解搜索由复杂度与误差引导的模型中。

关键词

引用

@article{arxiv.2310.17247,
  title  = {Grokking Beyond Neural Networks: An Empirical Exploration with Model Complexity},
  author = {Jack Miller and Charles O'Neill and Thang Bui},
  journal= {arXiv preprint arXiv:2310.17247},
  year   = {2024}
}