中文

超标记化 Transformer:词汇表始终是规模化的关键

计算与语言 2025-05-26 v2 机器学习

摘要

标记化是大型语言模型(LLM)的基本组件,但其对模型规模和性能的影响尚未充分探索。本文引入超标记化 Transformer(Over-Tokenized Transformers),一种新型框架,通过解耦输入和输出词汇表来提高语言建模性能。具体而言,我们的方法扩展输入词汇表以利用多词元(multi-gram)标记。通过大量实验,我们发现输入词汇表大小与训练损失之间存在对数线性关系,表明更大的输入词汇表始终能提升模型性能,无论模型规模如何。使用大型输入词汇表,我们可实现与双倍基线相当的性能,且无需额外计算成本。我们的发现凸显了标记化在规模化法则中的重要性,为 tokenizer 设计提供了实际见解,为更高效和强大的 LLM 铺平了道路。

关键词

引用

@article{arxiv.2501.16975,
  title  = {Over-Tokenized Transformer: Vocabulary is Generally Worth Scaling},
  author = {Hongzhi Huang and Defa Zhu and Banggu Wu and Yutao Zeng and Ya Wang and Qiyang Min and Xun Zhou},
  journal= {arXiv preprint arXiv:2501.16975},
  year   = {2025}
}

备注

accepted by ICML2025