在 LLM 中,特征蒸馏应转移哪些内容?基于任务切向几何的视角
计算与语言
2026-02-11 v3
摘要
基于特征的知识蒸馏旨在将教师 LLM 模型的中间表示转移到学生模型。现有方法通常依赖直接特征匹配或学习的投影,隐式地将表示视为具有内在意义的对象。然而,表示维度的相关性仅取决于其对模型输出的影响。在本 work 中,我们提出了一种基于功能的视角进行特征蒸馏。我们将知识转移表述为教师的功能几何,即其输出如何依赖于内部表示,而非直接的表示对齐。这一观点揭示了有效蒸馏无需保留完整的高维特征,而应保留功能贡献的主导方向,从而自然诱导出每个任务的有效功能维度。建立在此框架基础上,我们引入 Flex-KD,这是一种架构无关且无参数的蒸馏方法,能够在匹配学生表示容量的同时,转移教师的功能几何。广泛的实验在语言理解和生成基准上表明,Flex-KD 在各类场景下均优于现有蒸馏方法,尤其在教师-学生维度严重不匹配时表现尤为突出。
引用
@article{arxiv.2507.10155,
title = {What Should Feature Distillation Transfer in LLMs? A Task-Tangent Geometry View},
author = {Khouloud Saadi and Di Wang},
journal= {arXiv preprint arXiv:2507.10155},
year = {2026}
}