基于点积互信息的词向量对应性分析与比较研究
计算与语言
2026-03-11 v3
摘要
流行的词向量方法如GloVe和Word2Vec与点积互信息(PMI)矩阵的分解有关。本文在形式上建立了对应性分析(Correspondence Analysis, CA)与基于PMI的词向量方法之间的联系。CA是一种使用奇异值分解(SVD)的降维方法,我们展示了CA在加权PMI矩阵分解上与之密切相关。我们进一步引入了CA的变体用于词-上下文矩阵,即在平方根变换后应用的CA(ROOT-CA)以及在四次根变换后应用的CA(ROOTROOT-CA)。我们分析了这些方法的性能,检验了其成功或失败如何受分解矩阵中极端值影响。虽然我们的主要关注点是传统的静态词向量方法,但我们还包括了与基于转换器的编码器(BERT)的比较,以将结果置于上下文词向量的语境中。跨多个语料库和词相似性基准的实证评估表明,ROOT-CA和ROOTROOT-CA总体上略优于标准的基于PMI的方法,并与BERT的成绩相称。
引用
@article{arxiv.2405.20895,
title = {Correspondence Analysis and PMI-Based Word Embeddings: A Comparative Study},
author = {Qianqian Qi and Ayoub Bagheri and David J. Hessen and Peter G. M. van der Heijden},
journal= {arXiv preprint arXiv:2405.20895},
year = {2026}
}