基于 PMI 的词嵌入矩阵的低秩近似
计算与语言
2019-09-24 v1
摘要
我们在获取基于 PMI 的词嵌入这一问题下,对几种低秩近似方法进行了实证评估。所有词向量均在从英文维基百科(enwik9)提取的大型语料库的两等份数据集上训练,从中获得 PMI 矩阵。采用重复测量设计,将低秩近似方法(SVD、NMF、QR)与向量维数(250、500)分配给每个 PMI 矩阵复本。我们的实验表明,与其他两种低秩近似方法相比,从截断 SVD 获得的词向量在两个下游任务(相似度与类比)上取得了最佳性能。
引用
@article{arxiv.1909.09855,
title = {Low-Rank Approximation of Matrices for PMI-based Word Embeddings},
author = {Alena Sorokina and Aidana Karipbayeva and Zhenisbek Assylbekov},
journal= {arXiv preprint arXiv:1909.09855},
year = {2019}
}
备注
10 pages, 4 figures, CICLing 2019, Springer "Lecture Notes in Computer Science"