中文

一种用于词嵌入的基于排序的词汇相似度新度量

计算与语言 2017-12-25 v1

摘要

分布语义模型从上下文中的语言项导出词空间。意义通过定义对应于词汇实体的向量间距离度量获得。此类向量存在若干缺陷。本文为基线向量的后处理改进提供指南。我们聚焦于精炼相似性方面,通过应用中心性降低方法处理模型不完善之处,将关系知识引入模型,并给出一种新的排序相似度定义,其对排名第 1 的分量值赋予最大权重。该特征排序类似于信息检索中所用者。所有这些增强在联合 ESL 与 TOEF 数据集比较上均优于现有文献结果。由于单词语嵌入是任意语义任务的基本单元,可望此类任务的結果显著提升。此外,我们改进的文本处理方法可转用于生物序列的连续分布式表示,以服务于深度蛋白质组学与基因组学。

关键词

引用

@article{arxiv.1712.08439,
  title  = {Novel Ranking-Based Lexical Similarity Measure for Word Embedding},
  author = {Jakub Dutkiewicz and Czesław Jędrzejek},
  journal= {arXiv preprint arXiv:1712.08439},
  year   = {2017}
}

备注

7 pages; 1 page of references