用于矩阵补全的 PU 学习
机器学习
2014-11-25 v1 数值分析
机器学习
摘要
在本文中,我们考虑当观测值为某个底层矩阵 M 的单比特测量值,且特别是观测样本仅包含 1 而不包含 0 时的矩阵补全问题。该问题的动机源于现代应用,如推荐系统和社交网络,其中仅观测到“喜欢”或“好友关系”。这种仅从正例和未标记示例中学习的问题,称为 PU (positive-unlabeled) 学习,已在二分类背景下得到研究。我们考虑 PU 矩阵补全问题,其中底层实值矩阵 M 首先被量化以生成单比特观测值,然后揭示正条目的子集。在假设 M 具有有界核范数的前提下,我们为两种不同的观测模型提供了恢复保证:1) M 参数化一个生成二值矩阵的分布;2) M 被阈值化以获得二值矩阵。对于第一种情况,我们提出了一种“偏移矩阵补全”方法,仅使用对应于 1 的索引子集来恢复 M;而对于第二种情况,我们提出了一种“偏置矩阵补全”方法,用于恢复(阈值化后的)二值矩阵。两种方法均产生了强有力的误差界——如果 M 是 n 乘 n 矩阵,则 Frobenius 误差被限制为 O(1/((1-rho)n),其中 1-rho 表示观测到的 1 的比例。这意味着当 M 稠密且 n 较大时,仅需 O(n\log n) 个 1 的样本复杂度即可实现小误差。我们将我们的方法和保证扩展到了归纳矩阵补全问题,其中 M 的行和列具有关联特征。我们为这两种方法提供了高效且可扩展的优化程序,并展示了所提方法在链接预测(在包含超过 200 万个节点和 9000 万条链接的真实世界网络上)和半监督聚类任务中的有效性。
引用
@article{arxiv.1411.6081,
title = {PU Learning for Matrix Completion},
author = {Cho-Jui Hsieh and Nagarajan Natarajan and Inderjit S. Dhillon},
journal= {arXiv preprint arXiv:1411.6081},
year = {2014}
}