为形态丰富语言解析共享任务准备韩语数据
计算与语言
2013-09-11 v2
摘要
本文简要描述了为 SPMRL 2013 共享任务准备的韩语数据。该共享任务共使用了 27,363 个句子,包含 350,090 个词元。所有成分树均收集自 KAIST 树库并转换为 Penn Treebank 风格。所有依存树均使用专为 KAIST 树库设计的启发式规则和标注规则,从转换后的成分树转化而来。除了 KAIST 树库提供的金标准形态分析外,还为该共享任务提供了两套自动形态分析数据:一套由 HanNanum 形态分析器生成,另一套由 Sejong 形态分析器生成。
引用
@article{arxiv.1309.1649,
title = {Preparing Korean Data for the Shared Task on Parsing Morphologically Rich Languages},
author = {Jinho D. Choi},
journal= {arXiv preprint arXiv:1309.1649},
year = {2013}
}
备注
4 pages