中文

异构补充蒸馏

计算机视觉与模式识别 2026-02-16 v2

摘要

知识蒸馏(KD)将来自复杂教师的暗知识传递给紧凑的学生。然而,面对异构架构蒸馏(例如从 Vision Transformer(ViT)到 ResNet18),由于空间特征表示之间的差异,面临挑战。传统 KD 方法主要针对同构架构设计,因而难以有效解决这些差异。虽然最近开发了针对这些问题的异构 KD 方法,但它们往往会产生高的计算成本和复杂的设计,或过度依赖逻辑对齐,从而限制了其利用补充特征的能力。为克服这些限制,我们提出了异构补充蒸馏(HCD),这是一种简单而有效的框架,将教师和学生特征整合到共享逻辑中进行对齐表示。这些逻辑被分解并受约束,以促进对学生的多样化知识传递。具体而言,HCD 通过卷积投影器和自适应池化处理学生的中间特征,将其与来自 penultimate 层的教师特征拼接,然后通过由全连接层组成的补充特征映射器(CFM)模块生成共享逻辑。我们进一步引入子逻辑解耦蒸馏(SDD),将共享逻辑划分为 n 个子逻辑,用以与教师的逻辑融合以纠正分类。为确保子逻辑的多样性并减少冗余知识传递,我们提出了正交损失(OL)。通过保留学生的专项优势并利用教师知识,HCD 增强了学生的鲁棒性和泛化能力。在 CIFAR-100、细粒度(例如 CUB200)和 ImageNet-1K 数据集上进行的广泛实验表明,HCD 超过了最先进的 KD 方法,证明其是异构 KD 的有效解决方案。

关键词

引用

@article{arxiv.2511.10942,
  title  = {Heterogeneous Complementary Distillation},
  author = {Liuchi Xu and Hao Zheng and Lu Wang and Lisheng Xu and Jun Cheng},
  journal= {arXiv preprint arXiv:2511.10942},
  year   = {2026}
}

备注

Accepted by AAAI2026