中文

为形态丰富语言解析共享任务准备韩语数据

计算与语言 2013-09-11 v2

摘要

本文简要描述了为 SPMRL 2013 共享任务准备的韩语数据。该共享任务共使用了 27,363 个句子,包含 350,090 个词元。所有成分树均收集自 KAIST 树库并转换为 Penn Treebank 风格。所有依存树均使用专为 KAIST 树库设计的启发式规则和标注规则,从转换后的成分树转化而来。除了 KAIST 树库提供的金标准形态分析外,还为该共享任务提供了两套自动形态分析数据:一套由 HanNanum 形态分析器生成,另一套由 Sejong 形态分析器生成。

关键词

引用

@article{arxiv.1309.1649,
  title  = {Preparing Korean Data for the Shared Task on Parsing Morphologically Rich Languages},
  author = {Jinho D. Choi},
  journal= {arXiv preprint arXiv:1309.1649},
  year   = {2013}
}

备注

4 pages