OntoSenseNet的扩充:添加义项标注的泰卢固语词典
计算与语言
2018-07-10 v2
摘要
本文描述了OntoSenseNet的扩充——一个以动词为中心的印度语言词汇资源。该资源包含新开发的泰卢固语-泰卢固语词典。这很重要,因为当词及其释义均为泰卢固语时,母语者能更好地标注义项。因此致力于开发泰卢固语词典的软拷贝。我们的资源还具有人工标注的黄金标准语料库,包含8483个动词、253个副词和1673个形容词。标注由母语者依据既定标注指南完成。在本文中,我们提供标注流程的概览,并通过标注者间一致性展示资源的验证。讨论了义项类(sense-class)与义项类型(sense-type)的概念。此外,我们讨论了词汇义项标注语料库在改进词义消歧(word sense disambiguation, WSD)任务中的潜力。泰卢固语WordNet以众包方式标注同义词集中的个别词,并与所开发的义项标注词典(OntoSenseNet)比较以考察改进。同时,我们给出了形容词的一种特殊分类(时空分类)。
引用
@article{arxiv.1804.02186,
title = {Enrichment of OntoSenseNet: Adding a Sense-annotated Telugu lexicon},
author = {Sreekavitha Parupalli and Navjyoti Singh},
journal= {arXiv preprint arXiv:1804.02186},
year = {2018}
}
备注
Accepted Long Paper at 19th International Conference on Computational Linguistics and Intelligent Text Processing, March 2018, Hanoi, Vietnam