中文

基于形式化本体的词位分类及其应用

计算与语言 2018-07-06 v1

摘要

本文描述了 OntoSenseNet 的扩充——一个面向印度语言的以动词为中心的词汇资源。这项工作的一项主要贡献是通过开发一部真实的泰卢固语词典的计算版本来保存该词典。这一点很重要,因为当词及其含义均为泰卢固语时,母语者能更好地标注义类。因此,我们努力开发上述泰卢固语词典,并手动完成标注。手动标注的金标准语料库包含 8483 个动词、253 个副词和 1673 个形容词。标注由母语者依据既定的标注指南完成。在本文中,我们概述了标注流程,并通过标注者间一致性对所开发资源进行验证。来自泰卢固语 WordNet 的额外词汇被加入我们的资源,并通过众包方式进行标注。我们将统计数据与义类标注词典(即我们的资源)进行比较以获得更深入的认识。

关键词

引用

@article{arxiv.1807.01996,
  title  = {A Formal Ontology-Based Classification of Lexemes and its Applications},
  author = {Sreekavitha Parupalli and Navjyoti Singh},
  journal= {arXiv preprint arXiv:1807.01996},
  year   = {2018}
}

备注

Accepted as Oral Presentation at Second Edition of Widening Natural Language Processing (WiNLP) workshop in 16th Annual Conference of the North American Association for Computational Linguistics, NAACL HLT-2018. arXiv admin note: substantial text overlap with arXiv:1804.02186