面向多语言(从大型到濒危语言)的神经形态学数据集与模型
计算与语言
2021-05-27 v1
摘要
我们为形态丰富语言训练了用于形态分析、生成和词形还原的神经模型。我们提出了一种从 22 种语言的 FST(有限状态转录机)中自动提取大量训练数据的方法,其中 17 种为濒危语言。神经模型遵循与 FST 相同的标记集,以便能够作为 FST 的备用系统与之协同使用。源代码、模型和数据集已在 Zenodo 上发布。
引用
@article{arxiv.2105.12428,
title = {Neural Morphology Dataset and Models for Multiple Languages, from the Large to the Endangered},
author = {Mika Hämäläinen and Niko Partanen and Jack Rueter and Khalid Alnajjar},
journal= {arXiv preprint arXiv:2105.12428},
year = {2021}
}
备注
The 23rd Nordic Conference on Computational Linguistics (NoDaLiDa 2021)