基于共享参数交替零膨胀 Gamma 模型的高维共现计数数据的矩阵分解与预测
机器学习
2025-01-03 v1 机器学习
摘要
高维稀疏矩阵数据经常出现在各种应用场景中。一个典型例子是加权词-词共现计数数据,它总结了词对在同一语境窗口中出现的加权频率。此类数据通常包含高度倾斜的非负值和大量零值。另一个例子是商品-商品或用户-商品的共现情况,也会生成高维数据。目标是利用这些数据来预测项目之间的相关性或用户之间的相关性。本文假设物品或用户可以由未知的稠密向量表示。该模型将共现计数视为来自零膨胀 Gamma 随机变量的样本,并使用未知向量之间的余弦相似性来总结物品-物品的相关性。使用共享参数交替零膨胀 Gamma 回归模型 (SA-ZIG) 来估计未知值。我们考虑了标准链接和对数链接模型。提出了两种参数更新方案,并提出了用于估计未知参数的算法。提供了解析收敛性分析。数值研究表明,未经学习率调整的 SA-ZIG 使用 Fisher 打分可能无法找到最大似然估计。然而,带有学习率调整的 SA-ZIG 在我们的仿真研究中表现令人满意。
引用
@article{arxiv.2501.00628,
title = {Matrix factorization and prediction for high dimensional co-occurrence count data via shared parameter alternating zero inflated Gamma model},
author = {Taejoon Kim and Haiyan Wang},
journal= {arXiv preprint arXiv:2501.00628},
year = {2025}
}
备注
39 pages, 5 figures