中文

从逐图像低秩到编码不匹配:Vision Transformer特征蒸馏的再思考

计算机视觉与模式识别 2026-05-27 v3

摘要

特征图知识蒸馏(KD)在大小相当的Vision Transformer(ViT)之间能够良好地传递内部表示,但在压缩场景中往往失败。我们重新审视这种失败,并发现了一种悖论。样本级奇异值分解(SVD)表明,每张图像都高度可压缩,这似乎暗示一个窄体学生通过线性投影器应能够“原则上”匹配教师。然而,数据集层面的视角却与这种直觉相矛盾:PCA显示,教师是一个由低秩子空间组成的联合体,在不同输入之间存在显著的子空间旋转。我们进一步引入token级光谱能量模式(SEP),发现一种与体系结构无关的编码法则:即使它们生活在低秩子空间中,token也会在通道模式之间广泛分布能量,导致带宽不匹配。我们将这种现象称为编码不匹配。我们提出了两种最小修复方法:Lift或WideLast:(i)Lift在推理时保留轻量级升压投影器以提供更宽的通道数,或(ii)WideLast仅扩宽学生的最后模块,实现输入依赖的扩展。在ImageNet-1K上,这些修复方法使ViT压缩的特征KD得以复活,将DeiT-Tiny从CaiT-S24蒸馏的准确率从74.86%提升至77.53%/78.23%的top-1准确率,并且还能强化在无蒸馏训练的学生。我们的分析阐明了特征图KD何时为何会失败以及如何修复。代码和原始数据提供于https://github.com/thy960112/From-Per-Image-Low-Rank-to-Encoding-Mismatch。

关键词

引用

@article{arxiv.2511.15572,
  title  = {From Per-Image Low-Rank to Encoding Mismatch: Rethinking Feature Distillation in Vision Transformers},
  author = {Huiyuan Tian and Bonan Xu and Shijian Li},
  journal= {arXiv preprint arXiv:2511.15572},
  year   = {2026}
}

备注

22 pages, 22 figures. Accepted at the ICML 2026