中文

面向语言模型的多层次最优传输跨分词器知识蒸馏

计算与语言 2025-01-22 v2

摘要

知识蒸馏(KD)已成为压缩大型语言模型(LLM)的流行技术。现有KD方法受限于教师模型和学生模型需使用相同的分词器(即词汇表),限制了其在处理不同架构家族的LLM时的灵活性。本文引入一种多层次最优传输(MultiLevelOT)方法,推动最优传输实现通用跨分词器知识蒸馏。该方法通过多样化成本矩阵在token层面和序列层面对教师和学生的logit分布进行对齐,无需维度或逐token对应。token层面,MultiLevelOT通过联合优化序列中所有token来整合全局和局部信息,以提高鲁棒性。序列层面,我们通过Sinkhorn距离高效捕获logit分布的复杂结构,后者近似于Wasserstein距离用于离散度量。广泛实验表明,在提取问答、生成问答和摘要等任务上,MultiLevelOT在各种设置下均优于现有最先进的跨分词器KD方法。该方法对不同模型家族、架构和参数规模的学生和教师模型均表现出良好鲁棒性。代码和模型已发布于 https://github.com/2018cx/Multi-Level-OT。

关键词

引用

@article{arxiv.2412.14528,
  title  = {Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models},
  author = {Xiao Cui and Mo Zhu and Yulei Qin and Liang Xie and Wengang Zhou and Houqiang Li},
  journal= {arXiv preprint arXiv:2412.14528},
  year   = {2025}
}

备注

Accepted by AAAI 2025 (Oral)