中文

当前词形还原方法的比较:以爱沙尼亚语为例

计算与语言 2024-04-24 v1

摘要

本研究评估了三种不同的爱沙尼亚语词形还原方法——生成式字符级模型、基于模式的词级分类模型和基于规则的形态分析。根据我们的实验,一个显著较小的生成式模型始终优于基于EstBERT的模式分类模型。此外,我们观察到三种模型产生的错误重叠相对较小,表明不同方法的集成可能带来改进。

关键词

引用

@article{arxiv.2404.15003,
  title  = {Comparison of Current Approaches to Lemmatization: A Case Study in Estonian},
  author = {Aleksei Dorkin and Kairit Sirts},
  journal= {arXiv preprint arXiv:2404.15003},
  year   = {2024}
}

备注

6 pages, 2 figures