LLM训练中的分词器选择:微不足道还是至关重要?
机器学习
2024-03-19 v4
摘要
大型语言模型(LLMs)近期的成功主要由训练数据集构成策划、模型架构与数据集规模扩展以及预训练目标进展所驱动,而分词器的影响则成为盲区。为阐明这一未被充分探索的领域,我们通过训练24个参数为2.6B的单语与多语LLM,对不同的分词器算法与参数设置进行消融,就分词器选择对LLM下游性能的影响开展全面研究。我们的研究强调,分词器选择会显著影响模型的下游性能与训练成本。特别地,我们发现常用的分词器评估指标fertility与parity并不总能预测模型下游性能,使这些指标作为模型下游性能的代理值得质疑。此外,我们展示在五种最频繁欧洲语言上训练的多语分词器相较英语需要将词表规模增至三倍。尽管英语中心分词器过去被用于多语LLM训练,我们发现该方法导致严重的下游性能下降及高达68%的额外训练成本,源于低效的词汇分词。
引用
@article{arxiv.2310.08754,
title = {Tokenizer Choice For LLM Training: Negligible or Crucial?},
author = {Mehdi Ali and Michael Fromm and Klaudia Thellmann and Richard Rutmann and Max Lübbering and Johannes Leveling and Katrin Klug and Jan Ebert and Niclas Doll and Jasper Schulze Buschhoff and Charvi Jain and Alexander Arno Weber and Lena Jurkschat and Hammam Abdelwahab and Chelsea John and Pedro Ortiz Suarez and Malte Ostendorff and Samuel Weinbach and Rafet Sifa and Stefan Kesselheim and Nicolas Flores-Herr},
journal= {arXiv preprint arXiv:2310.08754},
year = {2024}
}