中文

面向韩语形态分析与词性标注的丰富字符级信息

计算与语言 2018-06-29 v1

摘要

由于韩语是一种高度黏着、字符丰富的语言,以往关于韩语形态分析的工作通常采用称为字素的子字符特征,或利用全面的语言先验知识(即已知形态变换形式或动作的词典)。这些模型的构建基于如下假设:由于所需动作数量庞大,无词典的字符级形态分析是不可行的。本研究提出一种基于多阶段动作的模型,可使用任意输入单元执行形态变换与词性标注,并将其应用于字符级韩语形态分析。在不使用语言先验知识的模型中,我们利用所提出的数据驱动Bi-LSTM模型在Sejong韩语语料上取得了词级与句级标注的SOTA准确率。

关键词

引用

@article{arxiv.1806.10771,
  title  = {Rich Character-Level Information for Korean Morphological Analysis and Part-of-Speech Tagging},
  author = {Andrew Matteson and Chanhee Lee and Young-Bum Kim and Heuiseok Lim},
  journal= {arXiv preprint arXiv:1806.10771},
  year   = {2018}
}

备注

10 pages, 6 figures, accepted as a conference paper at COLING 2018