通过几何感知表示对齐进行知识蒸馏
机器学习
2025-10-01 v1 人工智能
摘要
知识蒸馏是将能力从较大模型转移到较小模型的常见范式。传统蒸馏方法利用教师模型和学生模型输出上的概率散度,而基于特征的蒸馏方法通常最小化隐藏层表示之间欧几里得范数的变体。其主要目标是让学生模型模仿教师模型特征空间的结构。在本工作中,我们从理论上表明,现有的特征蒸馏方法,如基于投影的均方损失或中心核对齐(CKA),即使在损失为零的情况下也无法捕捉特征结构。随后,我们提出使用 Procrustes 距离和特征 Gram 矩阵的 Frobenius 范数作为蒸馏损失,这些距离在衡量表示对齐的背景下已很常见。我们表明,通过我们的方法进行特征蒸馏在语言模型家族(BERT 和 OPT)的分类和指令遵循任务中,展现出蒸馏性能在统计上显著的提升,最高达 2 个百分点,展示了将特征几何集成到现有蒸馏方法中的潜力。
关键词
引用
@article{arxiv.2509.25253,
title = {Knowledge distillation through geometry-aware representational alignment},
author = {Prajjwal Bhattarai and Mohammad Amjad and Dmytro Zhylko and Tuka Alhanai},
journal= {arXiv preprint arXiv:2509.25253},
year = {2025}
}