中文

基于齐夫定律的预训练模型词汇选择准则

机器学习 2025-07-31 v1 计算与语言

摘要

分词是自然语言处理(NLP)及其他序列建模领域中的基本步骤,词汇大小的选择显著影响模型性能。尽管其重要性已广为人知,但选择最佳词汇大小仍未得到充分探索,通常依赖于经验法则或数据集特定的选择。在本工作中,我们提出了通过分析词汇频率分布来确定词汇大小的原则方法,基于齐夫定律。我们表明,下游任务性能与词汇分布是否符合幂律行为密切相关,遵循齐夫比例可提高模型的效率和效果。跨 NLP、基因组学和化学的广泛实验表明,当词汇分布严格遵循齐夫定律时,模型始终能实现最佳性能,确立了齐夫对齐作为词汇大小选择的稳健且通用的标准。

关键词

引用

@article{arxiv.2507.22543,
  title  = {Pre-trained Models Perform the Best When Token Distributions Follow Zipf's Law},
  author = {Yanjin He and Qingkai Zeng and Meng Jiang},
  journal= {arXiv preprint arXiv:2507.22543},
  year   = {2025}
}