知识蒸馏的几何极限:基于超位置理论的最窄定理
机器学习
2026-04-08 v2 人工智能
摘要
知识蒸馏将大型教师模型压缩为更小的学生模型,但性能在损失地板上会饱和,这一现象在各种训练方法和目标下都持续存在。我们认为,这个地板是几何性的:神经网络通过超位置方式表示远多于维度的特征,宽度为 的学生模型最多只能编码 个特征,其中 为稀疏性相关的容量函数。超出此预算的特征将永久丢失,导致 importance 加权损失地板。我们在 toy model(48 种配置,准确率 >93%)和 Pythia-410M 上进行验证,在后者中稀疏自编码器测得 个特征,(关键宽度 )。蒸馏到五个不同宽度的学生模型确认了预测的单调地板顺序。观测到的地板可分解为几何组成部分和与宽度无关的结构基线()。线性探测显示,即使在 88% 特征丢失下,粗粒度概念仍能存活,这表明地板源于 importance 分布长尾中细粒度特征的总体损失。我们的结果将表示几何与蒸馏限制联系起来,并提供了一种从 SAE 测量alone 预测蒸馏性能的实用工具。
引用
@article{arxiv.2604.04037,
title = {Geometric Limits of Knowledge Distillation: A Minimum-Width Theorem via Superposition Theory},
author = {Nilesh Sarkar and Dawar Jyoti Deka},
journal= {arXiv preprint arXiv:2604.04037},
year = {2026}
}