基于谱分析的 Vision Transformer 解释与蒸馏统一框架——SpectralKD
最优化与控制
2025-03-11 v2
摘要
知识蒸馏(KD)在压缩大型 Vision Transformer(ViT)方面取得了广泛成功,但缺乏针对ViT和KD的统一理论框架。本文提出SpectralKD,一种新的统一分析框架,提供了对ViT的更深入见解,并通过谱分析优化KD。我们的模型级分析揭示,CaiT在其前几层和后几层集中信息,从而指导最佳层选择用于KD。意外的是,我们的层级分析发现,Swin Transformer和CaiT尽管具有不同的体系结构,却表现出相似的谱编码模式,导致特征图对齐指南。基于这些见解,我们提出了一种简单而有效的谱对齐方法用于KD。得益于上述分析结果的深入理解,即使是这种简单策略也能在ImageNet-1K上实现最先进的性能,在不引入任何可训练参数的情况下,将DeiT-Tiny的准确率提高5.2个百分点,将Swin-Tiny的准确率提高1.4个百分点。此外,我们的后处理分析揭示,蒸馏后的学生模型可以再现与教师模型相似的谱模式,开启了一个我们称之为“蒸馏动力学”的新领域。代码和实验日志可在 https://github.com/thy960112/SpectralKD 获取。
引用
@article{arxiv.2412.19054,
title = {Regularized neural network for general variational inequalities involving monotone couples of operators in Hilbert spaces},
author = {Pham Ky Anh and Trinh Ngoc Hai and Nguyen Van Manh},
journal= {arXiv preprint arXiv:2412.19054},
year = {2025}
}