SemToken:面向高效长上下文语言建模的语义感知分词
计算与语言
2025-08-22 v1 人工智能
摘要
分词在语言建模中起着关键作用,然而现有方法如字节对编码(BPE)或 WordPiece 仅基于频率统计进行操作,忽略了文本的底层语义结构。这导致对语义冗余片段过度分词,以及对上下文连贯性利用不足,尤其在长上下文场景中。在本工作中,我们提出 SemToken,一个语义感知的分词框架,旨在共同减少分词冗余并提高计算效率。SemToken 首先通过轻量级编码器提取上下文语义嵌入,并执行局部语义聚类以合并语义等价的词元。然后,它根据语义密度分配异构的词元粒度,允许在内容丰富的区域进行更细粒度的分词,而在重复或低熵片段进行更粗粒度的压缩。SemToken 可以与现代语言模型和注意力加速方法无缝集成。在 WikiText-103 和 LongBench 等长上下文语言建模基准上的实验表明,SemToken 实现了高达 2.4 倍的词元数量减少和 1.9 倍的加速,且困惑度和下游准确率几乎无下降或下降可忽略不计。我们的发现表明,语义结构为优化大语言模型中的分词和计算提供了一个有前景的新维度。
引用
@article{arxiv.2508.15190,
title = {SemToken: Semantic-Aware Tokenization for Efficient Long-Context Language Modeling},
author = {Dong Liu and Yanxuan Yu},
journal= {arXiv preprint arXiv:2508.15190},
year = {2025}
}