评估用于上下文词形还原的最短编辑脚本方法
计算与语言
2024-03-26 v1
摘要
现代上下文词形还原器通常依赖于自动诱导的最短编辑脚本(SES),即将词形转换为其词元所需的编辑操作次数。事实上,计算 SES 的不同方法已被提出,作为目前可用的几种 SOTA 上下文词形还原器架构的组成部分。然而,先前的工作尚未调查 SES 对最终词形还原性能的直接影响。在本文中,我们通过将词形还原视为一个词元分类任务来解决这一问题,其中模型接收的唯一输入是上下文中的词-标签对,其中标签对应于先前诱导的 SES。因此,通过在我们的词形还原系统中仅修改模型需要学习的 SES 标签,我们可以客观地得出哪种 SES 表示产生最佳词形还原结果的结论。我们使用多语言和特定语言的预训练纯编码器掩码语言模型作为骨干来构建我们的词形还原器,对七种不同形态复杂度的语言进行了实验,即英语、西班牙语、巴斯克语、俄语、捷克语、土耳其语和波兰语。全面的实验结果(包括域内和域外)表明,分别计算大小写和编辑操作总体上是有益的,但对于高屈折形态的语言更为明显。值得注意的是,多语言预训练语言模型在每种评估设置中始终优于其特定语言的对应模型。
引用
@article{arxiv.2403.16968,
title = {Evaluating Shortest Edit Script Methods for Contextual Lemmatization},
author = {Olia Toporkov and Rodrigo Agerri},
journal= {arXiv preprint arXiv:2403.16968},
year = {2024}
}
备注
13 pages, 7 tables. Accepted to LREC-COLING 2024