中文

构建多语言义原知识库:预测 BabelNet 同义集的义原

计算与语言 2019-12-05 v1 人工智能

摘要

义原被定义为人类语言的最小语义单位。包含标注义原的词语的义原知识库(KBs)已成功应用于许多自然语言处理(NLP)任务。然而,现有的义原知识库仅基于少数几种语言构建,这阻碍了其广泛应用。为解决该问题,我们提出基于多语言百科词典 BabelNet 构建一个统一的多语言义原知识库。我们首先构建一个数据集作为多语言义原知识库的种子。该数据集手动为超过 1515 千个同义集(BabelNet 的条目)标注义原。然后,我们提出一项同义集义原自动预测的新任务,旨在将种子数据集扩展为可用的知识库。我们还提出了两种简单而有效的模型,它们利用了同义集的不同信息。最后,我们进行定量与定性分析,以探究该任务中的重要因素与难点。本工作的所有源代码与数据可在 https://github.com/thunlp/BabelNet-Sememe-Prediction 获取。

关键词

引用

@article{arxiv.1912.01795,
  title  = {Towards Building a Multilingual Sememe Knowledge Base: Predicting Sememes for BabelNet Synsets},
  author = {Fanchao Qi and Liang Chang and Maosong Sun and Sicong Ouyang and Zhiyuan Liu},
  journal= {arXiv preprint arXiv:1912.01795},
  year   = {2019}
}

备注

Accepted by AAAI Conference on Artificial Intelligence 2020 for oral presentation