中文

双词嵌入空间模型的内在分析

计算与语言 2020-12-08 v2

摘要

近期的词嵌入技术将词语表示为连续向量空间中的向量,摆脱了过去原子化且稀疏的表示方式。每种此类技术还可基于嵌入维度大小、上下文窗口大小和训练方法等不同超参数设置,进一步生成多种变体。当我们特别考虑双嵌入空间技术(其输出不是一种而是两种词嵌入)时,会出现一种额外的变体。这引出了一个有趣的问题——“是否存在某一种或两种词嵌入变体的组合,对特定任务表现更优?”。本文通过考量所有这些变体来尝试回答该问题。在此,我们比较了属于两种不同方法的两类经典嵌入方法——基于窗口的 Word2Vec 与基于计数的 Glove。为在考虑所有变体后进行广泛评估,我们将总计 84 个不同模型在由 9 个开源语言学数据集构成的语义、关联和类比评估任务上进行了比较。最终的 Word2vec 报告显示,在 3 项任务中有 2 项更倾向于非默认模型。就 Glove 而言,非默认模型在所有 3 项评估任务中均表现更优。

关键词

引用

@article{arxiv.2012.00728,
  title  = {Intrinsic analysis for dual word embedding space models},
  author = {Mohit Mayank},
  journal= {arXiv preprint arXiv:2012.00728},
  year   = {2020}
}