中文

ThamizhiUDp:一种泰米尔语依存句法分析器

计算与语言 2020-12-29 v1

摘要

本文描述了我们如何开发了一个基于神经网络的依存句法分析器,即 ThamizhiUDp,它使用通用依存(Universal Dependency)形式化为泰米尔语文本提供完整的依存句法分析流程。我们考虑了依存句法分析流程的各个阶段,并在每个阶段确定了工具与资源,以提升准确率并应对数据稀缺问题。ThamizhiUDp 使用 Stanza 进行分词和词形还原,使用 ThamizhiPOSt 和 ThamizhiMorph 生成词性(POS)与形态学标注,并使用经多语言训练的 uuparser 进行依存句法分析。ThamizhiPOSt 是我们的词性标注器,基于 Stanza 并使用 Amrita 词性标注语料库训练,它以 93.27 的 F1 分数成为当前泰米尔语词性标注的最优模型。我们的形态分析器 ThamizhiMorph 是一个基于规则的系统,对泰米尔语具有很好的覆盖度。我们的依存句法分析器 ThamizhiUDp 使用多语言数据训练,其标记分配分数(LAS)为 62.39,比当前泰米尔语依存句法分析最佳成绩高出 4 分。因此,我们表明将依存句法分析流程拆分以适配现有工具与资源,对于低资源语言是一种可行的方法。

关键词

引用

@article{arxiv.2012.13436,
  title  = {ThamizhiUDp: A Dependency Parser for Tamil},
  author = {Kengatharaiyer Sarveswaran and Gihan Dias},
  journal= {arXiv preprint arXiv:2012.13436},
  year   = {2020}
}

备注

5 Pages, Published at ICON2020: 17th International Conference on Natural Language Processing (December 18-21, 2020)