用于含缺失值大数据草图绘制的在线类别子空间学习
机器学习
2017-08-02 v1
摘要
随着数据规模日益增长,高维数据的降维(亦称草图绘制)已成为至关重要的任务。对此需解决的相关问题包括:可能由类别样本构成的海量数据、典型的流式获取格式以及可能存在的缺失项。为应对这些挑战,本文提出一种新颖的类别子空间学习方法来揭示三种著名类别(双线性)模型——即Probit、Tobit和Logit——的潜在结构。确定性的Probit和Tobit模型将数据视为位于低维子空间中的模拟值过程的量化值,而概率性Logit模型依赖于数据对数似然比的低维性。利用所求模型的低内在维度,设计了秩正则化最大似然估计器,随后通过交替majorization-minimization递归求解,以实时草图绘制高维类别数据。所得过程在新不完整数据草图绘制与精炼潜在子空间之间交替,从而产生轻量级一阶算法,每次迭代任务高度并行化。作为额外自由度,量化阈值也与子空间联合学习,以增强所求模型的预测能力。分析了子空间迭代在无限和有限数据流下的性能:前者建立了向批估计器平稳点集的渐近收敛,后者推导了经验代价的次线性后悔界。基于合成与真实数据集的模拟测试证实了新方案在实时电影推荐和棋局分类中的优点。
引用
@article{arxiv.1609.08235,
title = {Online Categorical Subspace Learning for Sketching Big Data with Misses},
author = {Yanning Shen and Morteza Mardani and Georgios B. Giannakis},
journal= {arXiv preprint arXiv:1609.08235},
year = {2017}
}
备注
13 pages