中文

利用梵语遗产工具对DCS语料库进行验证与规范化以构建带标注的黄金语料库

计算与语言 2020-05-15 v1

摘要

梵语数字语料库(Digital Corpus of Sanskrit)记录了约650,000个句子及其形态与词汇标注。但形态分析的不一致,以及诸如分词单词等关键信息的缺失,迫切需要对这一语料库进行标准化与验证。自动化验证过程需要能提供缺失信息的高效分析器。梵语遗产引擎(Sanskrit Heritage Engine)的Reader可生成所有可能的分词及其形态与词汇分析。对齐这些系统将有助于我们记录语言差异,可用于更新这些系统以产生标准化结果,并将提供一个带有完整形态与词汇信息及分词单词标注的黄金语料库。Krishna等人(2017)考虑了部分语言差异,对齐了115,000个句子。由于这两个系统均已显著演进,我们重新进行了对齐,考虑了这些系统之间所有剩余的语言差异。本文详述了改进的对齐过程,并记录了观察到的额外语言差异。参考文献:Amrith Krishna, Pavankumar Satuluri, and Pawan Goyal. 2017. A dataset for Sanskrit word segmentation. In Proceedings of the Joint SIGHUM Workshop on Computational Linguistics for Cultural Heritage, Social Sciences, Humanities and Literature, page 105-114. Association for Computational Linguistics, August.

关键词

引用

@article{arxiv.2005.06545,
  title  = {Validation and Normalization of DCS corpus using Sanskrit Heritage tools to build a tagged Gold Corpus},
  author = {Sriram Krishnan and Amba Kulkarni and Gérard Huet},
  journal= {arXiv preprint arXiv:2005.06545},
  year   = {2020}
}