双前向路径教师知识蒸馏:弥合教师与学生网络容量差距
机器学习
2025-06-24 v1
摘要
知识蒸馏(KD)通过预训练教师网络为学生网络提供有效提升,但通常会导致教师与学生网络之间巨大的容量差距,限制了蒸馏效果。以往方法要么放弃准确的知识表示,要么无法动态调整传输的知识,对容量差距问题处理不力,阻碍了学生网络达到与预训练教师相当的性能。本文延续提示学习的理念,提出双前向路径教师知识蒸馏(DFPT-KD),用一种新颖的双前向路径教师取代预训练教师,引导学生网络的学习。DFPT-KD的关键在于基于提示的调优,即在预训练教师内部建立额外的基于提示的前向路径,并在保持教师预训练参数 frozen状态下进行优化,使传输知识与学生的表示能力相匹配。大量实验表明,DFPT-KD使训练后的学生性能优于常规KD。为进一步提升传输知识与学生表示能力的匹配度,我们进一步对整个基于提示的前向路径进行微调,得到一种新颖的蒸馏方法,称为DFPT-KD+。实验表明,DFPT-KD+在DFPT-KD基础上实现了最先进的准确率性能。
引用
@article{arxiv.2506.18244,
title = {Dual-Forward Path Teacher Knowledge Distillation: Bridging the Capacity Gap Between Teacher and Student},
author = {Tong Li and Long Liu and Yihang Hu and Hu Chen and Shifeng Chen},
journal= {arXiv preprint arXiv:2506.18244},
year = {2025}
}
备注
15pages