中文

将 Token 训练模型蒸馏为字节级模型

计算与语言 2026-02-03 v1

摘要

字节语言模型(Byte Language Models, BLMs)已成为超越分词扩展语言模型的有前景方向,但现有BLMs通常需要在数万亿字节上从头训练,导致成本高昂。本文提出一种高效蒸馏配方,将现有的 token 训练 LLM 转换为 BLMs,同时保持相当的能力。我们的配方遵循两阶段课程:(1)渐进式知识蒸馏,对齐字节级表示与 token 训练教师模型的嵌入;(2)字节级监督微调,使模型完全在字节空间进行端到端生成。我们在多个模型家族(包括 Llama、Qwen 和 OLMo)上验证了该方法,表明仅使用约125B字节,蒸馏后的 BLMs 即可保留大部分教师模型的性能。

关键词

引用

@article{arxiv.2602.01007,
  title  = {Distilling Token-Trained Models into Byte-Level Models},
  author = {Zishuo Bao and Jiaqi Leng and Junxiong Wang and Bowen Peng and Yucheng Lu},
  journal= {arXiv preprint arXiv:2602.01007},
  year   = {2026}
}

备注

17 pages, 3 figures, 13 tables