中文

LST20 语料库的标注指南

计算与语言 2020-08-13 v1

摘要

本报告介绍了 LST20 的标注指南,LST20 是一个用于泰语处理、具有多层语言标注的大规模语料库。我们的指南包含五层语言标注:分词、词性标注、命名实体、子句边界和句子边界。该数据集采用 CoNLL-2003 风格格式以便于使用。如前所述,LST20 语料库提供五层语言标注。在规模上,它包含 3,164,864 个词、288,020 个命名实体、248,962 个子句和 74,180 个句子,同时以 16 种不同的词性标签进行标注。所有 3,745 篇文档还以 15 种新闻体裁进行了标注。就其庞大规模而言,该数据集被认为足以用于开发 NLP 的联合神经模型。随着这一公开可用语料库的存在,泰语首次成为一种语言上丰富的语言。

关键词

引用

@article{arxiv.2008.05055,
  title  = {The Annotation Guideline of LST20 Corpus},
  author = {Prachya Boonkwan and Vorapon Luantangsrisuk and Sitthaa Phaholphinyo and Kanyanat Kriengket and Dhanon Leenoi and Charun Phrombut and Monthika Boriboon and Krit Kosawat and Thepchai Supnithi},
  journal= {arXiv preprint arXiv:2008.05055},
  year   = {2020}
}

备注

28 pages, 3 tables, 2 figures