利用外部资源增强序列到序列神经词形还原
计算与语言
2022-11-16 v1
摘要
我们提出一种新颖的混合词形还原方法,利用从外部词典或基于规则的系统中提取的额外词形来增强 seq2seq 神经模型。在训练期间,增强的词形还原器同时学习通过序列解码器生成词形,并从运行期提供的外部候选中复制词形字符。我们的词形还原器以增强自 Apertium 形态分析器的候选进行提升,与未利用额外词形信息的基线模型相比取得统计显著的改进,在 23 种 UD 语言集合上达到 97.25% 的平均准确率,比 Stanford Stanza 模型在同一语言集合上所得高 0.55%。我们还比较了将外部数据整合进词形还原的其他方法,并表明我们的增强系统明显优于基于 Stanza 系统的简单词典扩展方法,且相对于数据增强方法取得了互补的改进。
引用
@article{arxiv.2101.12056,
title = {Enhancing Sequence-to-Sequence Neural Lemmatization with External Resources},
author = {Kirill Milintsevich and Kairit Sirts},
journal= {arXiv preprint arXiv:2101.12056},
year = {2022}
}