中文

非负矩阵分解中的二至五条真谛

机器学习 2023-09-06 v2

摘要

在本文中,我们探讨了在使用非负矩阵分解构建主题模型时,矩阵缩放对计数矩阵的作用。我们提出了一种受图归一化拉普拉斯(normalized Laplacian, NL)启发的缩放,可极大提升非负矩阵分解的质量。结果与 Priebe 等人(2019)的谱图聚类工作相平行,其中作者证明了邻接谱嵌入(adjacency spectral embedding, ASE)谱聚类更可能发现核心-外围划分,而拉普拉斯谱嵌入(Laplacian Spectral Embedding, LSE)更可能发现亲和划分。在文本分析中,非负矩阵分解(non-negative matrix factorization, NMF)通常应用于“上下文”与“词项”共现计数的矩阵。受 LSE 启发的矩阵缩放在多种数据集上显著改善了文本主题模型。我们在三个具有人工标注的数据集上说明了 NMF 中矩阵缩放的显著差异可极大提升主题模型质量。使用调整兰德指数(adjusted Rand index, ARI)这一聚类相似性度量,我们看到相较于使用计数(即 ASE 的对应物),Twitter 数据提升 50%,新闻组数据集提升超 200%。对于干净数据,如来自文档理解会议的那些,NL 相较 ASE 有超 40% 的提升。我们以对该现象的一些分析以及此缩放与其他矩阵缩放方法的某些联系作结。

关键词

引用

@article{arxiv.2305.05389,
  title  = {Two to Five Truths in Non-Negative Matrix Factorization},
  author = {John M. Conroy and Neil P Molino and Brian Baughman and Rod Gomez and Ryan Kaliszewski and Nicholas A. Lines},
  journal= {arXiv preprint arXiv:2305.05389},
  year   = {2023}
}