全球低秩、局部满秩:学习算法的全息编码
机器学习
2026-02-24 v1 人工智能
摘要
grokking——即在持续训练后,从记忆向泛化的突变——被链接到学习动力学中低维结构的出现。然而,神经网络参数 inhabit 极高维空间。如何让低维学习过程产生抗低维压缩的解决方案?我们在多任务模块化算术中进行探索,训练具有独立加法、乘法和模 97 二次运算头的共享干 trunk Transformer。我们在三个模型规模(315K--2.2M 参数)和五个 weight decay 设置下,对比三种重建方法:逐矩阵奇异值分解 (SVD)、联合交叉矩阵 SVD 和轨迹 PCA。在所有条件下,grokking 轨迹局限于 2--6 维的全局子空间,而单个权重矩阵保持有效的满秩。仅需 3--5 个轨迹主成分即可恢复超过 95% 的最终准确率,而逐矩阵和联合 SVD 在亚满秩情况下均无法实现。即使静态分解捕获了大部分谱能,也会破坏任务相关结构。这些结果表明,学习算法是通过动态协调的更新跨越所有矩阵编码的,而非局部低秩组件。我们称之为全息编码原理:grokked 解决方案在学习方向空间中为全局低秩,但在参数空间中为局部满秩,这对压缩、可解释性以及理解神经网络如何编码计算具有深远影响。
引用
@article{arxiv.2602.18649,
title = {Global Low-Rank, Local Full-Rank: The Holographic Encoding of Learned Algorithms},
author = {Yongzhong Xu},
journal= {arXiv preprint arXiv:2602.18649},
year = {2026}
}
备注
14 pages, 3 figures, 6 tables