中文

迈向跨分词器蒸馏:面向大语言模型的通用 Logit 蒸馏损失

计算与语言 2025-01-28 v3

摘要

由于成本、延迟限制和硬件可用性等因素的制约,在大多数工业应用场景中部署数十亿参数的大语言模型 (LLM) 并不切实际。知识蒸馏 (KD) 通过将资源密集型大模型的知识压缩到较小模型中提供了解决方案。现有的各种策略中,有些依赖于教师模型生成的文本,并可选择利用其 logits 来增强学习。然而,这些基于 logits 的方法通常要求教师模型和学生模型共享相同的分词器 (tokenizer),限制了其在不同 LLM 家族间的适用性。在本文中,我们引入了基于最优传输理论的通用 Logit 蒸馏 (ULD) 损失,以解决这一局限性。实验结果证明了 ULD 损失在实现具有不同架构和分词器的模型间蒸馏的有效性,为蒸馏技术的更广泛应用铺平了道路。

关键词

引用

@article{arxiv.2402.12030,
  title  = {Towards Cross-Tokenizer Distillation: the Universal Logit Distillation Loss for LLMs},
  author = {Nicolas Boizard and Kevin El Haddad and Céline Hudelot and Pierre Colombo},
  journal= {arXiv preprint arXiv:2402.12030},
  year   = {2025}
}

备注

10 pages, 5 figures