面向大规模非线性半监督 AUC 优化的四重随机梯度
机器学习
2019-07-30 v1 机器学习
摘要
半监督学习在真实世界应用中十分普遍,其中仅有少量标注数据可用,而大量实例保持未标注。由于 AUC 是分类中重要的模型评估指标,在半监督学习场景下直接优化 AUC 已引起机器学习界的广泛关注。近来研究表明,人们可以在不知晓类别先验分布的情况下为半监督 AUC 最大化问题找到无偏解。然而,该方法在带核的非线性分类问题上几乎难以扩展。为解决此问题,本文提出一种新颖的可扩展四重随机梯度算法(QSG-S2AUC)用于非线性半监督 AUC 优化。在随机优化过程的每次迭代中,我们的方法随机采样一个正例、一个负例、一个未标注实例及其随机特征来计算梯度,然后利用该四重随机梯度更新模型以逼近最优解。更重要的是,我们证明 QSG-S2AUC 能以 O(1/t) 的速率收敛到最优解,其中 t 为迭代次数。在多种基准数据集上的大量实验结果表明,QSG-S2AUC 比现有的最先进半监督 AUC 最大化算法高效得多,同时保持了相似的泛化性能。
引用
@article{arxiv.1907.12416,
title = {Quadruply Stochastic Gradients for Large Scale Nonlinear Semi-Supervised AUC Optimization},
author = {Wanli Shi and Bin Gu and Xiang Li and Xiang Geng and Heng Huang},
journal= {arXiv preprint arXiv:1907.12416},
year = {2019}
}