中文

蒸馏动力学:迈向理解视觉 Transformer 中基于特征的蒸馏

计算机视觉与模式识别 2025-11-18 v2

摘要

尽管基于特征的知识蒸馏已被证明在压缩 CNN 方面非常有效,但这些技术在应用于视觉 Transformer(ViTs)时却意外失效,其表现往往不如简单的基于 logit 的蒸馏。我们通过一个被称为“蒸馏动力学”的新颖分析框架,结合频谱分析、信息熵度量和激活幅度跟踪,对这一现象提供了首次全面分析。我们的研究揭示了 ViT 表现出独特的 U 型信息处理模式:先压缩后扩张。我们确定了特征蒸馏中负迁移的根本原因:教师模型与学生模型之间存在根本的表征范式不匹配。通过频域分析,我们表明教师模型在后续层中采用分布式、高维编码策略,而较小的学生模型由于有限的通道容量无法复制这种策略。这种不匹配导致后层特征对齐主动损害学生模型的性能。我们的发现表明,ViT 中成功的知识迁移需要超越简单的特征模仿,转而采用尊重这些根本表征约束的方法,为设计有效的 ViT 压缩策略提供了重要的理论指导。所有源代码和实验日志可在 https://github.com/thy960112/Distillation-Dynamics 获取。

关键词

引用

@article{arxiv.2511.06848,
  title  = {Distillation Dynamics: Towards Understanding Feature-Based Distillation in Vision Transformers},
  author = {Huiyuan Tian and Bonan Xu and Shijian Li},
  journal= {arXiv preprint arXiv:2511.06848},
  year   = {2025}
}

备注

Accepted to AAAI 2026. Camera-ready version with appendix