中文

乌拉齐语 NLP 中的分词与形态学忠实度:跨语言评估

计算与语言 2026-03-31 v2

摘要

子词分词在自然语言处理中至关重要,影响模型性能,但在形态学复杂且资源有限的语言族中,其行为仍鲜有探索。本研究系统比较了三种子词范式——字节对编码(BPE)、重叠 BPE(OBPE)和单元语言模型——在六种乌拉齐语中的表现,这些语言在资源 availability 和类型学多样性方面各不相同。我们以词性标注为受控下游任务,展示 OBPE 在保持形态学一致性和提高标注准确率方面始终优于传统方法,尤其在拉丁脚本组中表现更佳。这些收益源于在开放类目中减少碎片化以及在频率谱中实现更好的平衡。迁移效能进一步取决于下游标注架构,与训练量和族系亲缘性相互作用。综上所述,这些发现表明,形态学敏感的分词不仅是预处理选择,更是启用 agglomerative 语言在跨语言迁移中起决定性作用的关键因素。

关键词

引用

@article{arxiv.2602.04241,
  title  = {Tokenization and Morphological Fidelity in Uralic NLP: A Cross-Lingual Evaluation},
  author = {Nuo Xu and Ahrii Kim},
  journal= {arXiv preprint arXiv:2602.04241},
  year   = {2026}
}