基于近似似然匹配的通用跨分词器蒸馏
计算与语言
2025-10-27 v4
摘要
蒸馏在将大型语言模型(LLM)教师中的知识传递给学生 LLM 方面显示出显著的成功。然而,当前的蒸馏方法需要教师和学生之间的分词器相似,这限制了其仅适用于小部分教师-学生对的可应用性。在本工作中,我们发展了一种原则性的跨分词器蒸馏方法,以解决这一关键缺陷。我们的方法是首次能够有效地跨越根本不同的分词器进行蒸馏,同时在所有其他情况下也显著优于先前的方法。我们在三个不同的用例上验证了该方法的有效性。首先,我们表明将分词器传递视为自蒸馏,使我们能够实现对分词器之间 unprecedentedly 有效的转移,包括将子词模型快速转移到字节级别。将不同模型转移到相同的分词器也可用于集成以提升性能。其次,我们将一个大型数学专用 LLM 蒸馏到一个小型通用模型,分词器不同,实现了具竞争力的解题性能。第三ly,我们使用该方法训练最先进的嵌入预测超网络,以实现无需训练的分词器转移。我们的结果解锁了蒸馏的广泛教师-学生配对,使我们能够以新方式适应和增强 LLM 之间的交互。
引用
@article{arxiv.2503.20083,
title = {Universal Cross-Tokenizer Distillation via Approximate Likelihood Matching},
author = {Benjamin Minixhofer and Ivan Vulić and Edoardo Maria Ponti},
journal= {arXiv preprint arXiv:2503.20083},
year = {2025}
}
备注
NeurIPS 2025