中文

在预训练和领域适应中充分利用你的分词器

计算与语言 2024-02-08 v2

摘要

分词是现代大语言模型(LLMs)中一个研究不足且常被忽视的组成部分。大多数已发表的工作在所有实验中使用单一的分词器,通常借用自另一个模型,而没有进行消融实验或分析来优化分词。此外,在微调基础模型时,分词器通常保持不变。在本文中,我们表明分词器的大小、预分词正则表达式和训练数据会显著影响模型的生成速度、有效上下文大小、内存使用和下游性能。我们训练了专门的字节对编码(Byte-Pair Encoding)代码分词器,并对分词器设计对LLM在代码生成任务(如HumanEval和MBPP)上性能的影响进行了广泛的消融实验,并为分词器超参数选择和切换预训练LLM中的分词器提供了建议。我们在从头训练和从预训练模型训练的模型上进行了实验,验证了它们对广泛用例的适用性。我们发现,当在超过500亿个token上进行微调时,我们可以专门化预训练LLM的分词器,从而在生成速度和有效上下文大小方面获得巨大收益。

关键词

引用

@article{arxiv.2402.01035,
  title  = {Getting the most out of your tokenizer for pre-training and domain adaptation},
  author = {Gautier Dagan and Gabriel Synnaeve and Baptiste Rozière},
  journal= {arXiv preprint arXiv:2402.01035},
  year   = {2024}
}