中文

基于两两相似度分布聚类的噪声标签学习

机器学习 2024-04-03 v1 计算机视觉与模式识别

摘要

噪声标签学习旨在使用大量带有噪声标签的样本训练深度神经网络,其主要挑战在于如何处理由错误标签导致的不准确监督。现有方法要么采用标签纠正范例,要么采用样本选择范例,以便将更多带有准确标签的样本纳入训练过程。本文提出一种简单而有效的样本选择算法,称为两两相似度分布聚类(PSDC),将训练样本划分为一个干净集合和另一个噪声集合,从而为任何可用的半监督学习方案提供进一步训练网络以适应不同下游任务的能力。具体而言,我们采用样本对之间的两两相似度来表示样本结构,并使用高斯混合模型(GMM)来建模属于同一噪声簇的样本对之间的相似度分布,从而可以自信地将每个样本划分为干净集合或噪声集合。即使在严重的标签噪声率下,所得数据分区机制在理论和实践中都被证明对于判断标签置信度更具鲁棒性。在各种基准数据集上进行的实验结果表明,该方法在CIFAR-10、CIFAR-100和Clothing1M等数据集上相对于最先进的方法具有显著的改进。

关键词

引用

@article{arxiv.2404.01853,
  title  = {Pairwise Similarity Distribution Clustering for Noisy Label Learning},
  author = {Sihan Bai},
  journal= {arXiv preprint arXiv:2404.01853},
  year   = {2024}
}