ReMem:面向有效知识蒸馏的预训练视觉 Transformer 互信息感知微调
机器学习
2025-07-01 v1 计算机视觉与模式识别
摘要
从预训练视觉表示模型进行知识蒸馏,提供了一种提升小型、面向任务的生产模型的有效途径。然而,当从大规模预训练的强模型进行蒸馏时,此类知识迁移的有效性会显著下降。在本文中,我们针对预训练 Vision Transformer (ViT) 探讨了使其微调后更利于知识迁移的方法,以应对这一挑战。鉴于互信息与蒸馏有效性之间的联系,我们提出在微调过程中采用互信息感知优化。针对此类优化效果较弱的较小或高度不平衡的下游数据集,我们引入了一种简单而有效的启发式方法,即对 MLP 块进行重加权。这一方法的灵感来自我们的观察:顶层 MLP 块是造成互信息损失的主要部分。我们的方法使小型学生模型能够从那些最强的预训练模型中受益。
引用
@article{arxiv.2506.23041,
title = {ReMem: Mutual Information-Aware Fine-tuning of Pretrained Vision Transformers for Effective Knowledge Distillation},
author = {Chengyu Dong and Huan Gui and Noveen Sachdeva and Long Jin and Ke Yin and Jingbo Shang and Lichan Hong and Ed H. Chi and Zhe Zhao},
journal= {arXiv preprint arXiv:2506.23041},
year = {2025}
}