用于半监督分类的深度低密度分离方法
机器学习
2022-05-25 v1
摘要
给定一小部分标注数据与一大部分未标注数据,半监督学习(SSL)试图利用未标注数据点的位置,以构建比仅将监督方法用于标注训练集所能获得的更好的分类器。有效的SSL对数据施加结构假设,例如相邻点更可能共享类别,或决策边界位于低密度区域。对于复杂高维数据,神经网络可学习特征嵌入,传统SSL方法随后可应用于此,即我们所称的混合方法。先前开发的混合方法在优化潜表示与在此表示上执行基于图的SSL之间迭代。本文引入一种新颖混合方法,其对嵌入特征应用低密度分离。我们详细描述该方法并讨论为何低密度分离比基于图的算法更适于神经网络嵌入上的SSL。我们使用内部客户调查数据验证方法,并与其他最先进学习方法比较。我们的方法从相对较少的人工分类样本中有效分类了数千未标注用户。
引用
@article{arxiv.2205.11995,
title = {Deep Low-Density Separation for Semi-Supervised Classification},
author = {Michael C. Burkhart and Kyle Shan},
journal= {arXiv preprint arXiv:2205.11995},
year = {2022}
}