逻辑回归线性模型中的Grokking现象
机器学习
2026-02-10 v1 人工智能
摘要
Grokking,即延迟泛化现象,常被归因于深度神经网络的深度和组合结构。我们研究了在最简单设置下(即在关于原点线性可分(且最大间隔)的二分类数据的逻辑损失下学习线性模型的Grokking)。我们检验了三种测试情景:(1)测试数据来自与训练数据相同的分布,其中不观察到Grokking;(2)测试数据集中围绕间隔,其中观察到Grokking;(3)通过投射梯度下降(Projected Gradient Descent, PGD)攻击生成的对抗测试数据,其中也观察到Grokking。我们理论上表明,梯度下降的隐式偏好会导致三相学习过程——人口主导、支持向量主导的unlearning和支持向量主导的泛化——其中延迟泛化可以由此产生。我们的分析进一步将Grokking的出现与数据中的不对称性相关,包括每类示例数量和支持向量在类别之间的分布不对称性,并给出Grokking时间的表征。我们通过种植不同的population点和support vector分布,以及分析准确率曲线和超平面动力学来实验验证我们的理论。总体而言,我们的结果表明,Grokking不需要深度或表示学习,甚至可以通过偏置项的动力学在线性模型中产生。
引用
@article{arxiv.2602.08302,
title = {Grokking in Linear Models for Logistic Regression},
author = {Nataraj Das and Atreya Vedantam and Chandrashekar Lakshminarayanan},
journal= {arXiv preprint arXiv:2602.08302},
year = {2026}
}