可扩展残差逼近用于知识蒸馏
计算机视觉与模式识别
2025-08-25 v1
摘要
知识蒸馏(KD)旨在将来自大规模教师模型的知识传递到轻量化模型中,从而显著降低计算和存储需求。然而,教师模型与学生模型之间固有的学习能力差距常常阻碍知识的充分传递,这促使大量研究旨在解决此挑战。灵感来源于石-Weierstrass定理中渐进逼近的原则,我们提出了可扩展残差逼近(Expandable Residual Approximation, ERA),这是一种新颖的KD方法,通过将残差知识的逼近分解为多个步骤来降低通过分割- conquering方法模拟教师表示的难度。具体而言,ERA采用多分支残差网络(Multi-Branched Residual Network, MBRNet)来实现残差知识的分解。此外,还引入了教师权重集成(Teacher Weight Integration, TWI)策略,以利用教师的注意力权重来缓解容量差距。大量实验表明,ERA在ImageNet分类基准中将Top-1准确率提升了1.41%,在MS COCO目标检测基准中将平均精度(AP)提升了1.40,同时在计算机视觉任务中实现领先性能。代码和模型已提供于https://github.com/Zhaoyi-Yan/ERA。
引用
@article{arxiv.2508.16050,
title = {Expandable Residual Approximation for Knowledge Distillation},
author = {Zhaoyi Yan and Binghui Chen and Yunfan Liu and Qixiang Ye},
journal= {arXiv preprint arXiv:2508.16050},
year = {2025}
}
备注
TNNLS 2025