中文

利用可计算的算法复杂度分析表征深度神经网络中的学习过程

机器学习 2026-05-18 v1

摘要

训练大规模深度神经网络(DNN)资源密集,使得模型压缩成为实际需求。广为接受的“学习即压缩”假说认为,训练会在网络权重中引入结构,从而实现压缩。通过柯尔莫哥洛夫-蔡廷-所罗门诺夫(KCS)复杂度来衡量这种结构很有吸引力,但基于编码定理方法(CTM)和块分解方法(BDM)的现有估计器仅限于小型二进制对象,无法扩展到现代 DNN。我们引入了量化块分解方法(QuBD),该方法将算法复杂度估计扩展到任意 k 元对象。QuBD 首先将网络权重量化到一个有限字母表,然后通过聚合每个位平面的 CTM 估计值来估计 KCS 复杂度。我们从理论上证明,与基于二值化的方法相比,QuBD 在真实 KCS 复杂度上产生了严格更紧的估计差距。利用 QuBD,我们研究了神经网络权重的算法复杂度在训练过程中的演变,结果表明,它随着模型学习而降低,随数据预算增加而增加,在过拟合期间增加,遵循 grokking 过程中观察到的延迟泛化现象,并与泛化性能相关。我们进一步表明,算法信息主要存在于最高有效位平面中,这可以作为确定适当训练后量化级别的实用诊断工具。这项工作通过为大型非二元对象(如 DNN 权重)提供首个可扩展、可计算的 KCS 复杂度估计,为理解 DNN 的学习机制提供了新颖的见解。

关键词

引用

@article{arxiv.2605.15551,
  title  = {Characterizing Learning in Deep Neural Networks using Tractable Algorithmic Complexity Analysis},
  author = {Pedram Bakhtiarifard and Sophia N. Wilson and Mahmoud Afifi and Jonathan Wenshøj and Raghavendra Selvan},
  journal= {arXiv preprint arXiv:2605.15551},
  year   = {2026}
}