中文

面向多式综合型极小资源语言的神经形态分割模型增强

计算与语言 2018-04-18 v1

摘要

多式综合语言的形态分割具有挑战性,因为一个词可能由许多独立的语素组成,且训练数据可能极其稀缺。由于神经序列到序列(seq2seq)模型在高资源环境下以及(主要是)欧洲语言的形态分割中定义了当前最优水平,我们首先表明,在极小资源环境下,它们对于墨西哥多式综合语言也能获得具有竞争力的性能。然后,我们提出两种新颖的多任务训练方法——一种需要、一种不需要外部无标注资源——以及两种相应的数据增强方法,在所有语言上均优于神经基线。最后,我们探索跨语言迁移作为增强神经模型的第三种方式,并表明我们可以为相关语言训练一个单一的多语言模型,同时保持相当甚至更好的性能,从而将参数量减少近75%。我们提供用于墨西哥语(Mexicano)、纳瓦特尔语(Nahuatl)、维沙里卡语(Wixarika)和约雷姆诺基语(Yorem Nokki)的形态分割数据集以供未来研究。

关键词

引用

@article{arxiv.1804.06024,
  title  = {Fortification of Neural Morphological Segmentation Models for Polysynthetic Minimal-Resource Languages},
  author = {Katharina Kann and Manuel Mager and Ivan Meza-Ruiz and Hinrich Schütze},
  journal= {arXiv preprint arXiv:1804.06024},
  year   = {2018}
}

备注

Long Paper, 16th Annual Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies