通过对应分析而非潜在语义分析改进信息检索
信息检索
2023-09-15 v1
摘要
潜在语义分析(LSA)与对应分析(CA)均是使用奇异值分解(SVD)进行信息检索的降维技术。理论上,LSA的结果既显示文档与词项之间的关联,也显示边际效应;相比之下,CA仅关注文档与词项之间的关联。边际效应通常与信息检索无关,因此从理论角度看,CA更适用于信息检索。本文对LSA与CA进行实证比较。对原始文档-词项矩阵的元素进行加权,并调整奇异值的加权指数以改进LSA的性能。我们探究这两种加权是否也能提升CA的性能。此外,我们比较LSA与CA的最优奇异值加权指数,以识别LSA中的初始维度对应什么。四个实证数据集的结果表明,CA始终优于LSA。对原始数据矩阵元素加权可改进CA;然而这取决于数据,且改进幅度很小。调整奇异值加权指数通常能提升CA性能;但改进程度取决于数据集与维度数量。一般而言,CA需要比LSA更大的奇异值加权指数才能获得最优性能。这表明CA比LSA更强调初始维度,因此边际在LSA的初始维度中起着重要作用。
引用
@article{arxiv.2303.08030,
title = {Improving information retrieval through correspondence analysis instead of latent semantic analysis},
author = {Qianqian Qi and David J. Hessen and Peter G. M. van der Heijden},
journal= {arXiv preprint arXiv:2303.08030},
year = {2023}
}