半监督学习中以拉普拉斯正则化克服维数灾难
机器学习
2021-11-30 v4 机器学习
摘要
由于大规模实际问题中数据标注可能稀缺,利用未标注样本是机器学习最重要的方面之一。这正是半监督学习的目标。为了从获取未标注数据中获益,将标注数据的知识平滑扩散至未标注数据是自然的做法。这导致了拉普拉斯正则化的使用。然而,当前拉普拉斯正则化的实现存在若干缺陷,尤其是著名的维数灾难。本文中,我们提供统计分析以克服这些问题,并揭示出一大类具有理想行为的谱滤波方法。它们通过(再生)核方法实现,我们为此提供了现实的计算指导,以使我们的方法能用于大量数据。
引用
@article{arxiv.2009.04324,
title = {Overcoming the curse of dimensionality with Laplacian regularization in semi-supervised learning},
author = {Vivien Cabannes and Loucas Pillaud-Vivien and Francis Bach and Alessandro Rudi},
journal= {arXiv preprint arXiv:2009.04324},
year = {2021}
}
备注
38 pages, 6 figures