用于极少标签数据分类的持久拉普拉斯增强算法
机器学习
2023-05-26 v1
摘要
许多机器学习(ML)方法的成功关键依赖于拥有大量标注数据。然而,对于许多应用而言,获取足够标注数据可能昂贵、耗时并受伦理约束。在应对此挑战中已显示出巨大价值的一种方法是半监督学习(SSL);该技术在训练时利用标注与未标注数据,通常标注数据远少于相对容易且廉价获得的未标注数据。事实上,SSL 方法在标注数据成本尤其高昂的应用中特别有用,如医学分析、自然语言处理(NLP)或语音识别。已取得巨大成功的 SSL 方法的一个子集涉及集成基于图技术的算法。这些过程因图形框架所提供的海量信息及其应用的通用性而流行。在本工作中,我们通过将持久谱图理论与经典 Merriman-Bence-Osher(MBO)格式相集成,提出一种基于代数拓扑的半监督方法,称为持久拉普拉斯增强图 MBO(PL-MBO)。具体而言,我们使用过滤过程生成链复形序列及相关的单纯复形族,由此构造持久拉普拉斯族。总体而言,这是一个非常高效的流程,与许多 ML 技术相比仅需少得多的标注数据即可表现良好,并且可适用于小数据集与大数据集。我们在数据分类上评估了所提方法的性能,结果表明所提技术优于其他现有半监督算法。
引用
@article{arxiv.2305.16239,
title = {Persistent Laplacian-enhanced Algorithm for Scarcely Labeled Data Classification},
author = {Gokul Bhusal and Ekaterina Merkurjev and Guo-Wei Wei},
journal= {arXiv preprint arXiv:2305.16239},
year = {2023}
}