用于确定非负矩阵分解中潜在维数的神经网络
机器学习
2020-06-23 v1 机器学习
摘要
非负矩阵分解(NMF)已被证明是一种强大的无监督学习方法,可用于在复杂且含噪声的数据集中揭示隐藏特征,其应用涵盖数据挖掘、文本识别、降维、人脸识别、异常检测、盲源分离等诸多领域。NMF 的一个重要输入是数据的潜在维数,即所探索数据集中存在的隐藏特征数 K。遗憾的是,该量很少能先验已知。我们结合一种称为 NMFk 的近期模型确定方法,利用监督式机器学习方法自动确定隐藏特征的数量。NMFk 通过对由初始数据集自助采样得到的矩阵集合执行一组 NMF 仿真,确定哪个 K 能产生稳定且能良好重构初始数据集的潜在特征组。随后,我们训练一个多层感知机(MLP)分类器网络,利用从 NMFk 获得的 NMF 解的统计量与特征来确定正确的隐藏特征数。为训练该 MLP 分类器,我们使用 NMFk 对 58,660 个具有预定潜在特征的矩阵进行了分解。将 MLP 分类器与 NMFk 结合应用于留出测试集时,成功率保持在 95% 以上。此外,将其应用于两个知名基准数据集(swimmer 与 MIT face 数据)时,NMFk/MLP 正确恢复了既定的隐藏特征数。最后,我们将本方法的精度与 ARD、AIC 及基于稳定性的方法进行了比较。
引用
@article{arxiv.2006.12402,
title = {A Neural Network for Determination of Latent Dimensionality in Nonnegative Matrix Factorization},
author = {Benjamin T. Nebgen and Raviteja Vangara and Miguel A. Hombrados-Herrera and Svetlana Kuksova and Boian S. Alexandrov},
journal= {arXiv preprint arXiv:2006.12402},
year = {2020}
}