X-Token:面向跨分词器知识蒸馏的投影引导方法
机器学习
2026-05-22 v1 计算与语言
摘要
跨分词器知识蒸馏允许学生模型从词汇表不兼容的教师模型中学习。先前工作基于隐藏状态或logits进行操作,后者作为不需要额外组件的即插即用替换选项。Logit-based方法要么仅使用正确token的概率,遗漏教师分布中完整的"dark knowledge",要么在完整输出分布上操作,依赖严格的token划分或不成熟的启发式排序。我们识别了完整分布、logit-based方法的两个关键短板:(i) 罕见token失败,即关键token落入未匹配子集中(例如,Llama的1100个多位数值在基于数字拆分的Qwen监督下)被训练时被抑制,导致GSM8k从12.89降至2.56与来自较弱教师的相同token KD相比;(ii) 过于保守的匹配,即严格的1对1匹配排除了跨表面形式的近等效token。这些失败需要不同的补救措施:消除关键token未对齐时的划分,以及在对齐可靠时细化划分。我们提出X-Token,一种针对这些问题的两种互补损失公式的做法。P-KL消除划分,通过稀疏投影矩阵W(初始化自tokenizer级别的字符串规则)将学生分布与教师分布对齐,以解决罕见token问题。H-KL保留混合形式,同时放宽匹配,使每个学生token与W下其最高排序的教师映射对齐。两个目标共享W,并可自然扩展到多个教师。在Llama-3.2-1B上,X-Token在使用Qwen3-4B教师时比当前最先进的GOLD提升了+3.82平均分,在使用Phi-4-Mini教师时提升了+0.5。进一步地,两个教师设置(Phi-4-mini + Llama-3B)比单一教师蒸馏提升了+1.3分。
引用
@article{arxiv.2605.21699,
title = {X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation},
author = {Sharath Turuvekere Sreenivas and Adithyakrishna Venkatesh Hanasoge and Mingyu Yang and Ali Taghibakhshi and Saurav Muralidharan and Ashwath Aithal and Pavlo Molchanov},
journal= {arXiv preprint arXiv:2605.21699},
year = {2026}
}