压缩前先分离:WWHO 分词架构
摘要
当前的大型语言模型(LLM)大多使用基于BPE(Byte Pair Encoding)的分词器,这种分词器对于简单结构的拉丁脚本(如英文)非常有效。然而,标准BPE分词器在处理复杂的阿鲁迈达脚本时会受到挑战,由于其结构复杂。问题在于,这些分词器将复杂复合字(多代码点 grapheme 集群)拆分为无意义的子字符单元。这会降低LLM的推理效率,因为迫使其在推理时学习基本的正字结构,并增加推理成本,在全球南方地区导致显著的“Token Tax”。我们提出了一种新的三层架构,WWHO(Where-What-How Often),以及一种名为SGPE(Syllable-aware Grapheme Pair Encoding)的算法,该算法在保持统计压缩过程同时将脚本的语言规则与统计压缩过程分离,并实现无缝的多语言分词。以Sinhala和Devanagari(印地语/梵文)作为高度复杂的阿鲁迈达脚本,我们在清理后的3000万句子数据集上训练WWHO,并在1499950句子的测试集上进行评估。对于Sinhala,SGPE实现了Token到Word比率(TWR)为1.274,每个token含4.83个字符,相较于OpenAI o200k base模型实现了61.7%的token减少。对于印地语,其TWR为1.181,相较于o200k模型实现了27.0%的减少。在混合脚本(Sinhala、Devanagari和英文)数据集上,SGPE实现了整体TWR为1.240,相较于o200k base、Llama 4 Scout和DeepSeek V3模型实现了36.7%、39.6%和60.2%的token减少。这有效地将这些阿鲁迈达语言的可用上下文窗口扩展了最高可达4.38倍,同时确保了语言零破坏保证,即不允许任何有效音节跨越多个token被拆分。
引用
@article{arxiv.2603.25309,
title = {Separate Before You Compress: The WWHO Tokenization Architecture},
author = {Kusal Darshana},
journal= {arXiv preprint arXiv:2603.25309},
year = {2026}
}
备注
17 pages, 1 figure, 8 tables. Tokenization Architecture including formal DFA definitions and regular expressions for Sinhala and Devanagari syllabification. Evaluation includes comparisons with OpenAI o200k-base, Llama-4-Scout, and DeepSeek-V3. Source code and datasets: https://github.com/remeinium/WWHO