AraToken:面向 Qwen3 的阿拉伯文分词优化,基于归一化管线与语言扩展
计算与语言
2025-12-23 v1 人工智能
摘要
分词是大型语言模型(LLM)的关键预处理步骤,直接影响训练效率和下游性能。专为英语和拉丁字符语言训练的通用分词器,在处理形态学复杂的阿拉伯语等语言时表现不佳,导致词序列膨胀和压缩效率下降。本文提出AraToken,一种基于 SentencePiece Unigram 算法的阿拉伯文优化分词器,构建完整的归一化管线,解决阿拉伯语特定的正字变体问题,包括阿尔法变体、 diacritics 以及阿拉伯数字。我们系统比较了 BPE、WordPiece 和 SentencePiece 算法在多个配置下的表现,证明采用归一化处理的 SentencePiece 在未归一化基线(1.35 tokens/词)中实现了 18% 的 fertility 降低(1.199 vs 1.35)。此外,我们引入语言扩展管线(LEP),通过词表扩展、均值子词初始化和选择性 transformer 层冻结解耦的方式,将优化后的分词器集成到 Qwen3-0.6B 中。实验表明,LEP 在 10 万阿拉伯语样本上训练 800 步后,将评估损失从 8.28 降至 2.43。我们公开分词器、训练脚本及模型检查点,以促进阿拉伯语 NLP 研究的开展。
关键词
引用
@article{arxiv.2512.18399,
title = {AraToken: Optimizing Arabic Tokenization with Normalization Pipeline and Language Extension for Qwen3},
author = {Mark Kashirskiy and Artiom Lipinski and Ilya Makarov},
journal= {arXiv preprint arXiv:2512.18399},
year = {2025}
}
备注
8 pages, 8 figures, 5 tables