中文

面向拉丁语编码器模型的语境相关形态学引导分词

计算与语言 2025-11-14 v1

摘要

分词是语言模型预训练中的关键组件,但标准分词方法往往侧重于信息论目标,如高压缩率和低产量,而非语言学目标如形态学对齐。在事实上,标准分词方法被证明在形态学丰富的语言上次优于最佳,分词质量直接影响下游性能。在本工作中,我们针对拉丁语——这是一种在预训练数据资源处于中等水平,但在精选词汇资源方面处于高资源状态的形态学丰富语言——探索形态学感知分词。我们发现,形态学引导的分词可提升四个下游任务的整体性能。性能提升在域外文本中最为显著,凸显了我们模型的更好泛化能力。我们的发现表明,语言资源对于改进高度形态学复杂语言的语言建模具有实用价值。对于缺乏大规模预训练数据的低资源语言,开发和整合语言资源可作为提升语言模型性能的可行替代方案。

关键词

引用

@article{arxiv.2511.09709,
  title  = {Contextual morphologically-guided tokenization for Latin encoder models},
  author = {Marisa Hudspeth and Patrick J. Burns and Brendan O'Connor},
  journal= {arXiv preprint arXiv:2511.09709},
  year   = {2025}
}