聚焦OOV:如何对它们进行屈折变化?
计算与语言
2024-05-29 v2
摘要
我们关注词汇外(OOV)条件下的形态屈折变化,这是一个研究不足的子任务,现有最先进系统在此通常效果不佳。我们开发了三个系统:一个逆行模型和两个基于LSTM和Transformer的序列到序列(seq2seq)模型。为了在OOV条件下进行测试,我们从形态丰富的捷克语中自动提取了一个大型名词数据集,采用引理不相交的数据划分,并进一步手动标注了一个真实世界的OOV新词数据集。在标准OOV条件下,Transformer取得了最佳结果,与LSTM、逆行模型和SIGMORPHON基线的集成性能不断提升。在真实世界的OOV新词数据集上,逆行模型优于所有神经模型。最后,我们的seq2seq模型在SIGMORPHON 2022共享任务数据的OOV评估(特征重叠)中,在大型数据条件下,在16种语言中的9种上达到了最先进的结果。我们发布了捷克语OOV屈折数据集,用于OOV条件下的严格评估。此外,我们将包含seq2seq模型的屈折系统作为即用型Python库发布。
引用
@article{arxiv.2404.08974,
title = {OOVs in the Spotlight: How to Inflect them?},
author = {Tomáš Sourada and Jana Straková and Rudolf Rosa},
journal= {arXiv preprint arXiv:2404.08974},
year = {2024}
}
备注
Published in the proceedings of LREC-COLING 2024. 12 pages, 3 figures