中文

基于显著性收益的BPE子词合并:对频率基准BPE的统计替代方案

计算与语言 2026-03-23 v1 计算机视觉与模式识别 机器学习

摘要

子词分词是现代语言模型(包括大语言模型,Large Language Models, LLMs)的关键设计选择,字节-和字符级BPE作为广泛使用的基准。标准BPE通过原始配对频率选择合并,这有利于压缩,但可能混淆真实的相邻内聚性与由于高边际计数而频繁的配对。本文引入显著性收益BPE(Significance-Gain BPE),作为一种 drop-in 替代方案,测度显著性通过独立性原null模型下的z统计量,并结合显式的压缩感知收益项。显著性收益BPE在WikiText-103(raw)字符片段上进行评估,使用小型因果Transformer语言模型,报告了token依赖的困惑度以及不以token为变量的度量bits per character(BPC)。在一个代表性的操作点,显著性收益BPE将验证和测试困惑度分别降低13%和12%,并将验证和测试BPC改进约0.9至1.0%。词汇大小扫描进一步表明,在大多数最近的压缩比较中,显著性收益BPE具有更低的BPC,这表明基于统计的合并选择可以在不同压缩范围内提高单位原始文本的预测效率。

关键词

引用

@article{arxiv.2603.19261,
  title  = {Significance-Gain Pair Encoding for LLMs: A Statistical Alternative to Frequency-Based Subword Merging},
  author = {Azam Nouri},
  journal= {arXiv preprint arXiv:2603.19261},
  year   = {2026}
}

备注

8 pages, 1 figures