在原空间中训练的拉普拉斯支持向量机
机器学习
2009-09-30 v1
摘要
近年来,由于未标注数据的日益普及,机器学习领域投入了大量精力来更好地理解并改进利用未标注数据的分类器质量。遵循流形正则化方法,拉普拉斯支持向量机在半监督分类中展现了最先进的性能。本文提出了两种求解原LapSVM问题的策略,以克服原始对偶公式的一些问题。在双空间中训练LapSVM需要两步,而使用原形式则可将训练压缩为一步。此外,使用预条件共轭梯度法,训练算法的计算复杂度从O(n^3)降低到O(n^2),其中n是标注和未标注样本的总数。我们通过基于未标注数据预测或(如果可用)基于标注验证样本的早停策略来加速训练。这使得算法能够快速计算近似解,其分类精度与最优解大致相同,从而显著减少训练时间。由于其简单性,在原空间中训练LapSVM可以成为原始LapSVM公式进一步改进的起点,例如处理大数据集。我们在真实世界数据上进行了广泛的实验评估,展示了所提出方法的优势。
引用
@article{arxiv.0909.5422,
title = {Laplacian Support Vector Machines Trained in the Primal},
author = {Stefano Melacci and Mikhail Belkin},
journal= {arXiv preprint arXiv:0909.5422},
year = {2009}
}
备注
39 pages, 14 figures