中文

分布语义建模:一种应用本体相关方法训练词项/词向量空间模型的改进技术

计算与语言 2022-01-04 v1 人工智能

摘要

我们设计了一种新的分布语义建模技术,采用基于神经网络的方法学习分布式词项表示(或词项嵌入)——即词项向量空间模型,其灵感来自近期用于词项识别(词项抽取)及其间关系识别(关系抽取)的本体相关方法(使用句法知识、术语知识、语义知识等不同类型的上下文知识),称为语义预处理技术——SPT。我们的方法依赖于从自然语言文本中自动抽取词项,并随后形成面向问题或面向应用(且深度标注)的文本语料库,其中基本实体为词项(包含非组合型与组合型词项)。这使我们得以从分布式词表示(或词嵌入)转向分布式词项表示(或词项嵌入)。这一转变将能生成更精确的不同主题域语义图(也包括输入词项间的关系——有助于探索聚类和对立,或检验关于它们的假设)。语义图可使用 Vec2graph(一个将词嵌入可视化为动态交互式图的 Python 库,此处为词项嵌入)以图形式表示。Vec2graph 库与词项嵌入结合不仅将提高标准 NLP 任务的准确性,还将更新自动化本体开发的传统概念。我们工作的主要实际成果是开发工具包(以 Web 服务 API 和 Web 应用形式表示的一组工具集),其为乌克兰语自然语言文本的基础语言预处理和语义预处理提供所有必要例程,以用于未来的词项向量空间模型训练。

关键词

引用

@article{arxiv.2003.03350,
  title  = {Distributional semantic modeling: a revised technique to train term/word vector space models applying the ontology-related approach},
  author = {Oleksandr Palagin and Vitalii Velychko and Kyrylo Malakhov and Oleksandr Shchurov},
  journal= {arXiv preprint arXiv:2003.03350},
  year   = {2022}
}

备注

In English, 9 pages, 2 figures. Not published yet. Prepared for special issue (UkrPROG 2020 conference) of the scientific journal "Problems in programming" (Founder: National Academy of Sciences of Ukraine, Institute of Software Systems of NAS Ukraine)