当前词形还原方法的比较:以爱沙尼亚语为例
计算与语言
2024-04-24 v1
摘要
本研究评估了三种不同的爱沙尼亚语词形还原方法——生成式字符级模型、基于模式的词级分类模型和基于规则的形态分析。根据我们的实验,一个显著较小的生成式模型始终优于基于EstBERT的模式分类模型。此外,我们观察到三种模型产生的错误重叠相对较小,表明不同方法的集成可能带来改进。
引用
@article{arxiv.2404.15003,
title = {Comparison of Current Approaches to Lemmatization: A Case Study in Estonian},
author = {Aleksei Dorkin and Kairit Sirts},
journal= {arXiv preprint arXiv:2404.15003},
year = {2024}
}
备注
6 pages, 2 figures