中文

面向1亿样本半监督学习的低秩标签传播

机器学习 2017-03-01 v1

摘要

半监督学习的成功关键依赖于对海量未标记数据的可扩展性,这些数据是捕捉底层流形结构以获得更好分类所必需的。由于在大多数类型的输入数据中计算训练数据间的成对相似性代价过高,目前尚无通用的即用型半监督学习方法/工具可用于处理数千万或更多数据点的学习。本文中,我们采用了两种低秩标签传播算法——GLNP(全局线性邻域传播)和核Nyström近似——的思想,并实现了这两种算法的并行版本,通过Nesterov加速投影梯度下降加速,用于大数据标签传播(BigLP)。这些并行算法在五个规模从7000到10,000,000的真实数据集和一个包含100,000,000样本的模拟数据集上进行了测试。实验中,该实现可扩展至具有100,000,000样本和数百个特征的数据集,并且当只有极小部分数据被标记时,算法也显著提高了预测精度。结果表明,BigLP实现对大数据具有高度可扩展性,并能有效利用未标记数据进行半监督学习。

关键词

引用

@article{arxiv.1702.08884,
  title  = {Low-rank Label Propagation for Semi-supervised Learning with 100 Millions Samples},
  author = {Raphael Petegrosso and Wei Zhang and Zhuliu Li and Yousef Saad and Rui Kuang},
  journal= {arXiv preprint arXiv:1702.08884},
  year   = {2017}
}