中文

通过 Token 翻译适配语言模型

计算与语言 2024-11-07 v2 人工智能 机器学习

摘要

现代大型语言模型使用固定的 tokenizer 来有效压缩来自源域的文本。然而,将相同的 tokenizer 应用于新的目标域往往会导致压缩效果变差、推理成本更高以及语义对齐性降低。为了解决这一缺陷,我们提出了稀疏 Sinkhorn Token 翻译(S2T2)。S2T2 为目标域训练了一个专门的 tokenizer,并学习在目标 token 和源 token 之间进行翻译,从而更有效地复用预训练的下一源 token 预测器。在微调英语语言模型的实验中,S2T2 改善了域外蛋白质序列的困惑度和压缩率,优于使用源 tokenizer 或目标 tokenizer 直接微调。此外,我们发现为较小、较便宜的模型学习的 token 翻译可以直接转移到更大、更强大的模型上,以较低的成本获得 S2T2 的好处。

关键词

引用

@article{arxiv.2411.00593,
  title  = {Adapting Language Models via Token Translation},
  author = {Zhili Feng and Tanya Marwah and Nicolo Fusi and David Alvarez-Melis and Lester Mackey},
  journal= {arXiv preprint arXiv:2411.00593},
  year   = {2024}
}