中文

深度网络总是会顿悟,原因在此

机器学习 2024-06-10 v2 人工智能 计算机视觉与模式识别

摘要

顿悟(Grokking),或称延迟泛化,是一种现象,即深度神经网络(DNN)在达到近乎零的训练误差后很久才出现泛化。以往的研究报告了顿悟在特定受控环境中的发生,例如使用大范数参数初始化的DNN或在算法数据集上训练的Transformer。我们证明,顿悟实际上更为普遍,并在广泛的实际场景中显现,例如在CIFAR10上训练卷积神经网络(CNN)或在Imagenette上训练ResNet。我们引入了延迟鲁棒性的新概念,即DNN在插值和/或泛化之后很久才顿悟对抗样本并变得鲁棒。我们基于DNN输入-输出映射的局部复杂性,对延迟泛化和延迟鲁棒性的出现提出了分析性解释。我们的局部复杂性度量了覆盖DNN输入空间的所谓线性区域(即样条划分区域)的密度,并作为训练的有用进展度量。我们首次证明,对于分类问题,线性区域在训练过程中经历相变,之后它们从训练样本迁移(使DNN映射在那里更平滑)并向决策边界迁移(使DNN映射在那里不那么平滑)。顿悟发生在相变之后,由于DNN映射在训练点附近的线性化,形成了输入空间的鲁棒划分。网站:https://bit.ly/grok-adversarial

关键词

引用

@article{arxiv.2402.15555,
  title  = {Deep Networks Always Grok and Here is Why},
  author = {Ahmed Imtiaz Humayun and Randall Balestriero and Richard Baraniuk},
  journal= {arXiv preprint arXiv:2402.15555},
  year   = {2024}
}

备注

ICML 2024. Website: https://bit.ly/grok-adversarial. Pages 24, Figures 36