中文

基于 PMI 的词嵌入矩阵的低秩近似

计算与语言 2019-09-24 v1

摘要

我们在获取基于 PMI 的词嵌入这一问题下,对几种低秩近似方法进行了实证评估。所有词向量均在从英文维基百科(enwik9)提取的大型语料库的两等份数据集上训练,从中获得 PMI 矩阵。采用重复测量设计,将低秩近似方法(SVD、NMF、QR)与向量维数(250、500)分配给每个 PMI 矩阵复本。我们的实验表明,与其他两种低秩近似方法相比,从截断 SVD 获得的词向量在两个下游任务(相似度与类比)上取得了最佳性能。

关键词

引用

@article{arxiv.1909.09855,
  title  = {Low-Rank Approximation of Matrices for PMI-based Word Embeddings},
  author = {Alena Sorokina and Aidana Karipbayeva and Zhenisbek Assylbekov},
  journal= {arXiv preprint arXiv:1909.09855},
  year   = {2019}
}

备注

10 pages, 4 figures, CICLing 2019, Springer "Lecture Notes in Computer Science"