潜在语义分析与文档-词项矩阵的对应分析之比较
信息检索
2024-11-20 v4 计算与语言
机器学习
摘要
潜在语义分析(LSA)与对应分析(CA)是两种利用奇异值分解(SVD)进行降维的技术。LSA 已被广泛用于获取捕捉文档与词项之间关系的低维表示。在本文中,我们对文档-词项矩阵背景下的这两种技术进行了理论分析与比较。我们表明,与 LSA 相比,CA 具有一些吸引人的性质,例如由不同文档长度和词项频率引起的边缘效应(即行元素与列元素之和)被有效消除,从而使得 CA 解最适于聚焦于文档与词项之间的关系。我们提出了一个统一框架,将 CA 和 LSA 均作为特例包含其中。我们在英文文本分类和荷兰历史文本的作者归属任务上对 CA 与多种基于 LSA 的方法进行了实证比较,发现 CA 表现显著更优。我们还将 CA 应用于关于荷兰国歌《威廉姆斯颂》作者归属的长期问题,并进一步支持其可归属于多位竞争者中的作者 Datheen。
引用
@article{arxiv.2108.06197,
title = {A comparison of latent semantic analysis and correspondence analysis of document-term matrices},
author = {Qianqian Qi and David J. Hessen and Tejaswini Deoskar and Peter G. M. van der Heijden},
journal= {arXiv preprint arXiv:2108.06197},
year = {2024}
}