中文

通过字节级接口实现跨分词器的大语言模型蒸馏

计算与语言 2026-04-14 v2

摘要

跨分词器蒸馏(CTD),即知识从教师语言模型转移到使用不同分词器的学生语言模型,仍然是一个基本未解决的问题。现有方法依赖于启发式策略来对齐不匹配的词汇表,引入了相当大的复杂性。在本文中,我们提出了一种简单但有效的基线方法,称为字节级蒸馏(BLD),它通过在所有分词器之间共享的接口——字节级——进行操作来实现CTD。更详细地说,我们将教师的输出分布转换为字节级概率,为学生附加一个轻量级的字节级解码器头,并通过这个共享的字节级接口进行蒸馏。尽管其简单性,BLD在一系列使用1B到8B参数模型的蒸馏任务中,其性能与显著更复杂的CTD方法相当,并且在几个基准测试上超越了它们。我们的结果表明,字节级是跨分词器知识转移的自然共同基础,同时也强调了在所有任务和基准测试上取得一致的改进仍然难以实现,这突显了CTD仍然是一个开放问题。

关键词

引用

@article{arxiv.2604.07466,
  title  = {Cross-Tokenizer LLM Distillation through a Byte-Level Interface},
  author = {Avyav Kumar Singh and Yen-Chen Wu and Alexandru Cioba and Alberto Bernacchia and Davide Buffelli},
  journal= {arXiv preprint arXiv:2604.07466},
  year   = {2026}
}