通过叠缩透镜的深度学习:一个简单模型为grokking、梯度提升等提供经验洞察
机器学习
2024-11-04 v1 人工智能
机器学习
摘要
深度学习有时会以意想不到的方式运作。为了更深入地理解其令人惊讶的行为,我们研究了一个简单而精确的训练神经网络模型——由一阶近似序列叠缩而成的单一经验操作工具,用于实际分析。通过三个案例研究,我们展示了它如何应用于从文献中提取关于多种显著现象的新经验洞察——包括双下降、grokking、线性模式连通性以及在表格数据上应用深度学习的挑战——强调该模型使我们能够构建和提取有助于预测和理解神经网络先验意外性能的指标。我们还展示了该模型提供了一种教学形式化方法,使我们能够在复杂的当代环境中隔离训练过程的组成部分,提供了一个推理架构和优化策略等设计选择影响的透镜,并揭示了神经网络学习与梯度提升之间的惊人平行关系。
引用
@article{arxiv.2411.00247,
title = {Deep Learning Through A Telescoping Lens: A Simple Model Provides Empirical Insights On Grokking, Gradient Boosting & Beyond},
author = {Alan Jeffares and Alicia Curth and Mihaela van der Schaar},
journal= {arXiv preprint arXiv:2411.00247},
year = {2024}
}
备注
Accepted at Conference on Neural Information Processing Systems (NeurIPS) 2024