奇异值分解的聚类与潜在语义索引方面
机器学习
2012-11-19 v4 数值分析
谱理论
摘要
本文讨论奇异值分解(SVD)的聚类和潜在语义索引(LSI)方面。本文的目的有二。第一是解释奇异向量如何以及为何可用于聚类。第二是表明这两个看似无关的SVD方面实际上源于同一源头:在SVD低秩近似矩阵的图表示中,相关顶点比在原始语义图中更倾向于聚集在一起。因此,SVD可以提高信息检索系统的检索性能,因为对近似矩阵进行的查询比原始矩阵的相同查询能检索到更多相关文档并过滤掉更多不相关文档。利用这一事实,我们将设计一种LSI算法,该算法模仿SVD在聚类相关顶点方面的能力。收敛性分析表明,该算法是收敛的,并且对每个输入产生唯一解。使用LSI研究中一些标准数据集的实验结果表明,该算法的检索性能与SVD相当。此外,该算法更实用且更易使用,因为无需确定分解秩,而分解秩对SVD的检索性能至关重要。
引用
@article{arxiv.1011.4104,
title = {Clustering and Latent Semantic Indexing Aspects of the Singular Value Decomposition},
author = {Andri Mirzal},
journal= {arXiv preprint arXiv:1011.4104},
year = {2012}
}
备注
38 pages, submitted to Pattern Recognition