中文

衡量 Grokking 中的锋利性

机器学习 2024-02-15 v1

摘要

神经网络有时会表现出 grokking 现象,即在相同的训练集性能已获得后,仍在验证集上实现完美或近乎完美的性能。本文介绍了一种衡量 grokking 的稳健方法,基于对合适函数形式的拟合。我们随后利用这一方法调查了在两种设置下训练和验证准确率转换锋利性的趋势。第一种设置是 Levi 等人 (2023) 开发的理论框架,其中可轻松获取闭形式表达式。第二种设置是训练的两层 MLP,用于预测位的奇偶性,grokking 通过 Miller 等人 (2023) 的隐蔽策略诱导。我们发现,在使用绝对和相对锋利性度量时,两种设置下的相对 grokking 间隙和 grokking 锋利性之间的趋势相似。反思这一发现,我们对某些趋势有了进展,并确定需要进一步研究来厘清影响 grokking 锋利性的各种机制。

关键词

引用

@article{arxiv.2402.08946,
  title  = {Measuring Sharpness in Grokking},
  author = {Jack Miller and Patrick Gleeson and Charles O'Neill and Thang Bui and Noam Levi},
  journal= {arXiv preprint arXiv:2402.08946},
  year   = {2024}
}