中文

改变 LLM 词汇表的适配器:哪些语言受益最大?

计算与语言 2025-03-18 v3

摘要

词汇表适应技术通过将新词汇整合到预训练语言模型中,实现对新语言的扩展并缓解词元过度碎片化问题。然而,现有方法受限于依赖启发式方法或外部嵌入。我们提出了 VocADT,这是一种 novel 的词汇表适应方法,利用适配器模块训练,以学习现有嵌入的最优线性组合,同时保持模型权重不变。VocADT 提供了一个灵活且可扩展的解决方案,不依赖外部资源或语言限制。在 11 种语言(具有多样化脚本、资源可获得性和碎片化程度)上,我们展示了 VocADT 在各种多语言任务(包括自然语言理解和机器翻译)中超越原始 Mistral 模型和其他基线方法。我们发现拉丁脚本语言和高度碎片化语言从词汇表适应中受益最大。我们进一步对适配后模型在机器翻译生成任务上的微调结果表明,词汇表适应在微调后仍然具有益处,且 VocADT 是最有效的方法。

关键词

引用

@article{arxiv.2410.09644,
  title  = {Adapters for Altering LLM Vocabularies: What Languages Benefit the Most?},
  author = {HyoJung Han and Akiko Eriguchi and Haoran Xu and Hieu Hoang and Marine Carpuat and Huda Khayrallah},
  journal= {arXiv preprint arXiv:2410.09644},
  year   = {2025}
}

备注

ICLR2025