中文

一种通用分词器统一解决多语言大语言模型的语言塑性问题

计算与语言 2025-06-13 v1

摘要

为众多语言同时进行大规模多语言大语言模型(LLM)预训练面临模型容量有限、高质量数据稀缺以及计算资源受限等挑战。此外,分词器的语言覆盖不足也使得仅通过后训练阶段来覆盖新语言更加困难。本文研究在训练早期通过进行哪些相对廉价的干预可以提高"语言塑性"(即模型在后训练阶段适应新语言的能力)。我们关注分词器设计,提出使用通用分词器,该分词器为预训练语言之外的更多语言进行训练,以在预训练后高效扩展语言覆盖。我们的系统性实验覆盖多样化的语言群组和不同的训练策略,表明通用分词器相对于仅为预训练语言设计的专用分词器,使语言适应能力显著提升,赢率可提高最高达 20.2%。此外,通用分词器还能对完全未见于分词器和预训练中的语言具有更好的塑性,赢率提升最高可达 5%。我们以最小程度的性能牺牲实现了对扩展语言集合的适应,保持了预训练中大多数语言的优异性能。

关键词

引用

@article{arxiv.2506.10766,
  title  = {One Tokenizer To Rule Them All: Emergent Language Plasticity via Multilingual Tokenizers},
  author = {Diana Abagyan and Alejandro R. Salamanca and Andres Felipe Cruz-Salinas and Kris Cao and Hangyu Lin and Acyr Locatelli and Marzieh Fadaee and Ahmet Üstün and Sara Hooker},
  journal= {arXiv preprint arXiv:2506.10766},
  year   = {2025}
}