Kvistur 2.0:面向冰岛语的 BiLSTM 复合词分割器
计算与语言
2020-04-17 v1
摘要
本文提出一种基于字符的 BiLSTM 模型用于分割冰岛语复合词,并展示了不同规模的训练数据如何影响模型性能。复合构词在冰岛语中极具能产性,新复合词不断被创造出来。这导致大量未登录词(OOV)的出现,对许多自然语言处理工具的性能造成负面影响。我们的模型在来自冰岛语形态数据库、包含 290 万唯一词形及其构成结构的语料上进行训练。该模型学习将复合词拆分为两部分,并可用于推导任意词形的构成结构。知晓词形的构成结构后,便能为给定任务生成最优分割,例如用于子词分词的全分割,或在词性标注情形下将 OOV 词一直拆分至找到最大的已知形态学词首。在人工分割词形语料上的评测表明,该模型优于其他已发表的方法。此方法已集成至冰岛语复合词分析器 Kvistur 中。
引用
@article{arxiv.2004.07776,
title = {Kvistur 2.0: a BiLSTM Compound Splitter for Icelandic},
author = {Jón Friðrik Daðason and David Erik Mollberg and Hrafn Loftsson and Kristín Bjarnadóttir},
journal= {arXiv preprint arXiv:2004.07776},
year = {2020}
}
备注
Accepted at LREC 2020