中文

具有代表性区域的在线凸矩阵分解

机器学习 2019-05-30 v2 机器学习

摘要

矩阵分解(MF)是一种通用的学习方法,已在各种数据驱动的学科中得到广泛应用。然而,许多 MF 算法不能充分随可用数据集的规模扩展,和/或缺乏可解释性。为了提高该方法的计算效率,Mairal 等人 [2010] 提出了一种在线(流式)MF 算法。为了实现数据可解释性,Ding 等人 [2010] 引入了 MF 的约束版本,称为凸 MF。在后一项工作中,基向量被要求位于数据样本凸包内,从而确保每个基都可以被解释为数据样本的加权组合。目前尚无已知的在线凸 MF 算法解决方案,因为在不访问完整数据集的情况下找到适当的凸基是具有挑战性的。我们通过提出首个在线凸 MF 算法来解决这两个问题,该算法维护每组基(Ding 等人 [2010])解释所需的恒定大小的代表性数据样本集合,并具有与 Mairal 等人 [2010] 的在线学习算法相同的几乎必然收敛保证。我们的证明技术将随机坐标下降算法与专门的拟鞅收敛分析相结合。在合成和真实世界数据集上的实验表明,与经典凸 MF 相比,所提出的在线凸 MF 方法显著节省了计算量。由于所提出的方法维护了凸解释所需的小型代表性数据样本集,它与理论计算机科学中有关生成点集(Blum 等人 [2016])以及计算机视觉中有关原型分析(Mei 等人 [2018])的一系列工作相关。尽管如此,它在目标函数和算法实现方面都与这些工作不同。

关键词

引用

@article{arxiv.1904.02580,
  title  = {Online Convex Matrix Factorization with Representative Regions},
  author = {Abhishek Agarwal and Jianhao Peng and Olgica Milenkovic},
  journal= {arXiv preprint arXiv:1904.02580},
  year   = {2019}
}