通过正交匹配追踪实现无训练分词器移植
计算与语言
2025-06-10 v1 人工智能
机器学习
摘要
我们提出了一种无训练方法,用于通过正交匹配追踪(OMP)将预训练大型语言模型(LLM)的分词器进行移植。具体而言,我们通过 OMP 重建不可见的 token 嵌入。具体步骤包括:首先,使用小型共享锚定 token 字典计算每个新 token 在捐赠嵌入空间中的表示,然后将相同的稀疏系数传输回基本模型的嵌入空间。在两个具有挑战性的跨分词器任务——LlamaMistral NeMo(12B)和 QwenLlama(1B)——上,我们展示了 OMP 在保持基本模型性能方面实现了最佳零样态表现,而其他零样态方法则显著退化。与基线(zero-init、mean-init 以及现有方法如 WECHSEL、FOCUS、ZETT)相比,OMP 始终实现了最佳的整体性能,有效地在无需梯度更新的情况下弥合大型分词器差异。我们的分析进一步指出,错位的数值化词典方案是保持数学推理能力的关键挑战。该技术使我们能够直接重用预训练模型权重以新的分词器,促进跨分词器知识蒸馏、推测解码、集成、合并以及特定于领域的词汇调整。我们将该方法集成到开源的 mergekit-tokensurgeon 工具中,用于后期词汇对齐。
引用
@article{arxiv.2506.06607,
title = {Training-Free Tokenizer Transplantation via Orthogonal Matching Pursuit},
author = {Charles Goddard and Fernando Fernandes Neto},
journal= {arXiv preprint arXiv:2506.06607},
year = {2025}
}