基于相依印度自助餐过程的稀疏非参数非负矩阵分解
机器学习
2015-07-14 v1
摘要
非负矩阵分解 (NMF) 旨在将一个矩阵分解为两个适合预期应用的优化非负矩阵。该方法已广泛用于无监督学习任务,包括推荐系统(用户对项目的评分矩阵)和文档聚类(论文对关键词的权重矩阵)。然而,传统的 NMF 方法通常假设潜在因子(即载荷矩阵的维度)的数量是固定的。这一假设使它们对许多应用缺乏灵活性。本文提出了一种非参数 NMF 框架,通过使用相依印度自助餐过程 (dIBP) 来缓解此问题。简而言之,我们应用一个相关函数来生成与每对载荷矩阵列相关联的两个棍断权重,同时仍保持它们各自由 IBP 指定的边缘分布。因此,两个载荷矩阵的生成将是逐列(间接)相关的。在同一框架下,提出了两类相关函数:(1) 使用二元贝塔分布和 (2) 使用 Copula 函数。两种方法都允许我们通过灵活选择合适的参数设置来将我们的工作应用于各种场景。与该领域的其他最先进方法(例如使用基于高斯过程 (GP) 的 dIBP)相比,我们的工作在允许两个对应的二元矩阵列在其非零条目上有更大变化方面显得更加灵活。我们在真实世界和合成数据集上的实验表明,与不预定义因子矩阵维度的标准 NMF 相比,所提出的三个模型在文档聚类任务上表现良好,并且基于二元贝塔分布和基于 Copula 的模型比基于 GP 的模型具有更好的灵活性。
引用
@article{arxiv.1507.03176,
title = {Dependent Indian Buffet Process-based Sparse Nonparametric Nonnegative Matrix Factorization},
author = {Junyu Xuan and Jie Lu and Guangquan Zhang and Richard Yi Da Xu and Xiangfeng Luo},
journal= {arXiv preprint arXiv:1507.03176},
year = {2015}
}
备注
14 pages, 10 figures