面向土耳其语的混合分词方法:令语意的令牌
计算与语言
2026-04-01 v3
摘要
分词塑造了语言模型如何感知土耳其语中的形态学和意义,而广泛使用的基于频率的子词分词器(如字节对编码 BPE 和 WordPiece)可能会以掩盖形态学边界的方式碎片化高度形态学丰富和屈指可数语言。我们介绍了一种面向土耳其语的语言学信息混合分词器,组合 (i) 基于词典的形态学分段(词根和缀词)、(ii) 音系规范化,将所有omorphic 变体映射到共享标识符,以及 (iii) 受控的子词后备,用于覆盖 OOV。具体而言,我们的发布词汇表包含 22,231 个词根令牌映射到 20,000 个规范词根标识符(带前导空格以标记词边界)、72 个后缀标识符覆盖 177 个 allomorphic 表面形式,以及 12,696 个子词单元;一种正字形大小写令牌保留大小写而不膨胀词汇表。我们在 TR-MMLU 数据集上评估了分词质量,使用两种语言对齐指标:土耳其令牌百分比(TR~%),即产生的令牌中对应土耳其词典/形态学单元的比例;纯令牌百分比(Pure~%),即与无歧义词根/后缀边界对齐的令牌比例。该分词器在 TR-MMLU 上达到 90.29% TR~% 和 85.80% Pure~%,显著优于几款通用分词器。我们进一步在严格的随机初始化控制下验证了下游句子嵌入基准,以隔离分词器的归纳偏差。对于四个匹配模型(TurkishTokenizer、CosmosGPT2、Mursit 和 Tabi),TurkishTokenizer 在土耳其 STS 基准测试中超越所有基线,并在 MTEB-TR 中实现最强的整体平均性能。它还在 TurBLiMP 下的基于质心的代理方法中取得最强的平均准确率。
引用
@article{arxiv.2508.14292,
title = {Tokens with Meaning: A Hybrid Tokenization Approach for Turkish},
author = {M. Ali Bayram and Ali Arda Fincan and Ahmet Semih Gümüş and Sercan Karakaş and Banu Diri and Savaş Yıldırım and Demircan Çelik},
journal= {arXiv preprint arXiv:2508.14292},
year = {2026}
}