中文

基于词汇课程的大规模语言模型预训练扩展

计算与语言 2025-02-26 v1 人工智能

摘要

现代语言模型依赖于在预训练之前固定的静态词汇表,这与人类语言学习中适应性词汇习得形成对比。为弥合这一差距,我们引入了词汇课程学习,一种通过相对于词汇表大小的对数线性扩展增益来提高预训练效率的方法。我们的方法在熵引导的词汇扩展与模型优化之间交替进行,使模型能够在不同的分词粒度下学习可迁移的表示。这种方法自然地产生了最优的计算分配模式:较长的标记捕获可预测的内容,而较短的标记专注于更复杂、更难预测的上下文。在小规模 GPT 模型上的实验展示了改进的扩展效率,证明了动态分词的有效性。我们发布了代码以支持进一步的研究,并计划将实验扩展到更大的模型和更多样化的领域。

关键词

引用

@article{arxiv.2502.17910,
  title  = {Scaling LLM Pre-training with Vocabulary Curriculum},
  author = {Fangyuan Yu},
  journal= {arXiv preprint arXiv:2502.17910},
  year   = {2025}
}

备注

under review