中文

知识蒸馏的几何极限:基于超位置理论的最窄定理

机器学习 2026-04-08 v2 人工智能

摘要

知识蒸馏将大型教师模型压缩为更小的学生模型,但性能在损失地板上会饱和,这一现象在各种训练方法和目标下都持续存在。我们认为,这个地板是几何性的:神经网络通过超位置方式表示远多于维度的特征,宽度为 dSd_S 的学生模型最多只能编码 dSg(α)d_S \cdot g(\alpha) 个特征,其中 g(α)=1/((1α)ln11α)g(\alpha) = 1/((1-\alpha)\ln\frac{1}{1-\alpha}) 为稀疏性相关的容量函数。超出此预算的特征将永久丢失,导致 importance 加权损失地板。我们在 toy model(48 种配置,准确率 >93%)和 Pythia-410M 上进行验证,在后者中稀疏自编码器测得 F28,700F \approx 28{,}700 个特征,α0.992\alpha \approx 0.992(关键宽度 dS1,065d_S^* \approx 1{,}065)。蒸馏到五个不同宽度的学生模型确认了预测的单调地板顺序。观测到的地板可分解为几何组成部分和与宽度无关的结构基线(R2=0.993R^2 = 0.993)。线性探测显示,即使在 88% 特征丢失下,粗粒度概念仍能存活,这表明地板源于 importance 分布长尾中细粒度特征的总体损失。我们的结果将表示几何与蒸馏限制联系起来,并提供了一种从 SAE 测量alone 预测蒸馏性能的实用工具。

关键词

引用

@article{arxiv.2604.04037,
  title  = {Geometric Limits of Knowledge Distillation: A Minimum-Width Theorem via Superposition Theory},
  author = {Nilesh Sarkar and Dawar Jyoti Deka},
  journal= {arXiv preprint arXiv:2604.04037},
  year   = {2026}
}