基于 KL 散度的大语言模型词汇扩展自蒸馏方法
计算与语言
2026-01-14 v2 人工智能
摘要
大型预训练语言模型在微调小型专业语料库时,常常难以 incorporates new domain-specific terminology。本文通过引入基于 KL 散度的知识蒸馏方法,解决在冻结 LLM 中进行词汇扩展的挑战。即使原始模型和扩展模型使用不同的 tokenization 方式,我们的方法也允许 student 模型在词汇不同的情况下从 teacher 继承分布式知识。这使得我们能够将 KL 基于蒸馏方法与传统交叉熵训练进行比较,评估多种用于初始化 new token embeddings 的策略。embedding 初始化后,模型进一步微调以整合新的词汇。每个训练好的模型在约 2000 个 code-generation 任务上进行 benchmark,我们的方法在所有情况下均取得最佳性能。最后,通过机制可解释性,我们分析模型如何学习 new token 的表示,解释了所观察到的 gains,并提供了关于 embedding space 在词汇扩展期间结构的见解。
引用
@article{arxiv.2508.15807,
title = {Vocabulary Expansion of Large Language Models via Kullback-Leibler-Based Self-Distillation},
author = {Max Rehman Linder},
journal= {arXiv preprint arXiv:2508.15807},
year = {2026}
}
备注
Master's Thesis