中文

一种基于规则/BPSO的低维语义基向量集生成方法

计算与语言 2021-11-29 v1 最优化与控制

摘要

我们旨在生成低维的显式分布语义向量。在显式语义向量中,每个维度对应一个词,因此词向量具有可解释性。在本研究中,我们提出一种获取低维显式语义向量的新方法。首先,该方法将词相似度、零值数量和词频这三个标准作为语料库中词的特征。然后,我们基于这三个特征绘制的决策树,提取一些规则来获取初始基词。其次,我们提出一种基于二元粒子群优化算法的二元加权方法,用于获取 N_B = 1000 个上下文词。我们还使用一种词选择方法,提供 N_S = 1000 个上下文词。第三,我们基于二元加权方法提取语料库的黄金词。然后,将提取的黄金词添加到由词选择方法选出的上下文词中,作为黄金上下文词。我们使用 ukWaC 语料库来构建词向量,并使用 MEN、RG-65 和 SimLex-999 测试集来评估词向量。我们报告了与使用语料库中 5k 个最频繁词作为上下文词的基线方法相比较的结果。基线方法使用固定窗口来统计共现。我们使用 1000 个选定的上下文词以及黄金上下文词来获得词向量。与基线方法相比,我们的方法在 MEN、RG-65 和 SimLex-999 测试集上的斯皮尔曼相关系数分别提高了 4.66%、14.73% 和 1.08%。

关键词

引用

@article{arxiv.2111.12802,
  title  = {A Rule-based/BPSO Approach to Produce Low-dimensional Semantic Basis Vectors Set},
  author = {Atefe Pakzad and Morteza Analoui},
  journal= {arXiv preprint arXiv:2111.12802},
  year   = {2021}
}