中文

用于含噪标签数据分类的半监督级联聚类

机器学习 2022-05-05 v1 人工智能

摘要

当数据带有噪标签时,监督分类技术的性能通常会退化。即便半监督分类方法也主要只关注处理缺失标签的问题。大多数处理噪标签数据的方法依赖于深度神经网络(DNN),其分类任务需要海量数据集。这在过程和制造工业中尤其构成严峻挑战,因为那里数据有限且标签含噪。我们提出一种半监督级联聚类(SSCC)算法,以在此类数据集中提取模式并生成级联的类树。引入了一种带有可配置超参数的新颖聚类评估矩阵(CEM),用于定位并消除噪标签,并对级联聚类施加剪枝准则。该算法降低了对昂贵人类专家评估标签准确性的依赖。基于SSCC生成的分类器即使在噪标签数据集上训练也准确且一致。在多个含噪标签数据集(包括一个工业数据集)上测试时,其表现优于支持向量机(SVM)。所提方法可有效用于工业环境中以最少人类专业知识获取可操作洞察。

关键词

引用

@article{arxiv.2205.02209,
  title  = {Semi-Supervised Cascaded Clustering for Classification of Noisy Label Data},
  author = {Ashit Gupta and Anirudh Deodhar and Tathagata Mukherjee and Venkataramana Runkana},
  journal= {arXiv preprint arXiv:2205.02209},
  year   = {2022}
}

备注

11 pages