论文重审:跨架构蒸馏:轻量级视频模型的自适应双教师传递
计算机视觉与模式识别
2025-11-13 v1
摘要
Vision Transformer(ViT)在视频动作识别中取得了强大的性能,但其高计算成本限制了实际应用。轻量级CNN更高效,但在准确率上存在差距。跨架构知识蒸馏(CAKD)通过将ViT的知识传递给CNN来解决这一问题,但现有方法常常在架构不匹配方面困难,并忽视了更强的同构CNN教师的价值。为解决这些挑战,我们提出了双教师知识蒸馏框架,利用异构ViT教师和同构CNN教师协同指导轻量级CNN学生。我们引入了两个关键组件:(1)不确定性感知教师加权,动态地通过基于教师置信度和与学生预测不一致性分配自适应权重来融合ViT和CNN教师的预测,从而实现更具信息性和有效性的监督;(2)结构不一致感知蒸馏策略,其中学生通过轻量级辅助分支学习ViT和CNN教师之间的残差特征,专注于可转移的架构差异,而无需模仿ViT的所有高维模式。在包括HMDB51、EPIC-KITCHENS-100和Kinetics-400在内的多个基准测试上进行了大量实验,证明我们的方法在准确率上持续优于最先进的蒸馏方法,在HMDB51上实现了最高可达5.95%的准确率提升。
引用
@article{arxiv.2511.09469,
title = {Revisiting Cross-Architecture Distillation: Adaptive Dual-Teacher Transfer for Lightweight Video Models},
author = {Ying Peng and Hongsen Ye and Changxin Huang and Xiping Hu and Jian Chen and Runhao Zeng},
journal= {arXiv preprint arXiv:2511.09469},
year = {2025}
}
备注
2 figures, 7 tables