中文

重新思考丰富形态学中的分词:Unigram 优于 BPE 和形态对齐

计算与语言 2025-11-11 v3 人工智能

摘要

分词器算法(例如,字节对编码(BPE)、Unigram)、形态对齐、分词质量(例如,压缩效率)与下游性能之间的关系在很大程度上仍不清晰,特别是对于形态复杂的语言。在本文中,我们使用小型 BERT 模型——从预训练到微调——对泰卢固语(黏着语)的分词器进行了全面评估,并对印地语(主要为屈折语,带有一些黏着特征)和英语(屈折语)进行了初步评估。为了评估泰卢固语分词器的形态对齐情况,我们创建了一个包含 600 个派生词形和 7000 个屈折词形的黄金词素分割数据集。我们的实验揭示了泰卢固语的两个关键发现。首先,分词器算法的选择是影响性能的最显著因素,基于 Unigram 的分词器在大多数设置下始终优于 BPE。其次,虽然更好的形态对齐与文本分类和结构预测任务的性能呈中等程度的正相关,但其影响次于分词器算法。值得注意的是,使用形态信息进行预分割的混合方法显著提升了 BPE 的性能,但对 Unigram 则不然。我们的结果进一步表明,需要为分词器制定全面的内在评估指标,以一致地解释下游性能趋势。

关键词

引用

@article{arxiv.2508.08424,
  title  = {Rethinking Tokenization for Rich Morphology: The Dominance of Unigram over BPE and Morphological Alignment},
  author = {Saketh Reddy Vemula and Sandipan Dandapat and Dipti Misra Sharma and Parameswari Krishnamurthy},
  journal= {arXiv preprint arXiv:2508.08424},
  year   = {2025}
}