中文

EVE:基于维基百科的可解释向量嵌入技术

计算与语言 2017-02-23 v1

摘要

我们提出了一种无监督的可解释词嵌入技术,称为 EVE,它建立在维基百科的结构之上。所提出的模型使用人类可读的标签来定义表示一个词的语义向量的维度,因此它易于解释。具体来说,每个向量是利用维基百科类别图结构以及维基百科文章链接结构构建的。为了测试所提出的词嵌入模型的有效性,我们考虑了它在三个基本任务中的有用性:1) 入侵者检测——评估其从一组连贯向量中识别出非连贯向量的能力,2) 聚类能力——评估其将相关向量分组在一起同时将不相关向量保留在分离的簇中的倾向,以及 3) 相关项优先排序——评估其将与查询相关的向量(项)排在结果前列的能力。对于每个任务,我们还提出了一种策略,从模型生成特定于任务的人类可解释的解释。这些证明了 EVE 生成的可解释嵌入的整体有效性。最后,我们在三个任务中将 EVE 与 Word2Vec、FastText 和 GloVe 嵌入技术进行了比较,并报告了相对于最先进技术的改进。

关键词

引用

@article{arxiv.1702.06891,
  title  = {EVE: Explainable Vector Based Embedding Technique Using Wikipedia},
  author = {M. Atif Qureshi and Derek Greene},
  journal= {arXiv preprint arXiv:1702.06891},
  year   = {2017}
}