立场:先求解逐层线性模型以理解神经动力学现象(神经坍缩、涌现、Lazy/Rich 机制与 Grokking)
机器学习
2025-05-27 v2 机器学习
数据分析、统计与概率
摘要
在物理学中,复杂系统常被简化为仅保留核心原理的最小可解模型。在机器学习中,逐层线性模型(如线性神经网络)充当了神经网络动力学的简化表示。这些模型遵循动力学反馈原理,该原理描述了各层如何相互支配并放大彼此的演化。这一原理超越了简化模型,成功解释了深度神经网络中广泛的动力学现象,包括神经坍缩、涌现、Lazy 和 Rich 机制以及 Grokking。在这篇立场文章中,我们呼吁使用保留神经动力学现象核心原理的逐层线性模型,以加速深度学习的科学研究。
引用
@article{arxiv.2502.21009,
title = {Position: Solve Layerwise Linear Models First to Understand Neural Dynamical Phenomena (Neural Collapse, Emergence, Lazy/Rich Regime, and Grokking)},
author = {Yoonsoo Nam and Seok Hyeong Lee and Clementine C J Domine and Yeachan Park and Charles London and Wonyl Choi and Niclas Goring and Seungjai Lee},
journal= {arXiv preprint arXiv:2502.21009},
year = {2025}
}
备注
accepted to ICML 2025 position track