GliLem:利用 GliNER 实现爱沙尼亚语的上下文词形还原
计算与语言
2025-01-14 v3
摘要
我们提出了 GliLem——一种新颖的爱沙尼亚语混合词形还原系统,它通过基于 GliNER 的外部消歧模块增强了高精度的基于规则的形态分析器 Vabamorf。GliNER 是一个开放词汇的 NER 模型,能够将文本跨度与自然语言中的文本标签匹配。我们利用预训练 GliNER 模型的灵活性,将 Vabamorf 的词形还原准确率比其原始消歧模块提高了 10%,并且比基于令牌分类的基线有所改进。为了衡量词形还原准确率改进对信息检索下游任务的影响,我们首先通过自动将 DBpedia-Entity 数据集从英语翻译过来,创建了一个爱沙尼亚语信息检索数据集。我们使用 BM25 算法在创建的数据集上基准测试了几种令牌归一化方法,包括词形还原。我们观察到,使用词形还原比简单的词干提取在 IR 指标上有显著改进。提高词形消歧准确率的好处体现在 IR 召回率指标上,虽然微小但持续改进,特别是在高 k 设置下。
引用
@article{arxiv.2412.20597,
title = {GliLem: Leveraging GliNER for Contextualized Lemmatization in Estonian},
author = {Aleksei Dorkin and Kairit Sirts},
journal= {arXiv preprint arXiv:2412.20597},
year = {2025}
}
备注
Accepted to NoDaLiDa/Baltic-HLT 2025. Minor presentation and formatting fixes