MixMOOD:一种利用深度数据集不相似性度量系统处理半监督学习中类别分布不匹配的方法
机器学习
2020-06-16 v1 机器学习
摘要
在这项工作中,我们提出了MixMOOD——一种系统性的方法,用于减轻使用MixMatch的半监督深度学习(SSDL)中类别分布不匹配的影响。这项工作分为两个部分:(i) 一个用于SSDL的广泛分布外(OOD)消融测试平台,以及 (ii) 一种称为MixMOOD的定量无标签数据集选择启发式方法。在第一部分中,我们分析了MixMatch准确度在三个多类分类任务中90种不同分布不匹配场景下的敏感性。这些场景旨在系统地理解OOD无标签数据如何影响MixMatch的性能。在第二部分中,我们提出了一种高效且有效的方法,称为深度数据集分布相似性度量(DeDiMs),用于比较有标签和无标签数据集。所提出的DeDiMs评估快速且与模型无关。它们使用通用Wide-ResNet的特征空间,并可在学习前应用。我们的测试结果表明,有标签和无标签数据之间假定的语义相似性并不是无标签数据选择的良好启发式方法。相比之下,MixMatch准确度与所提出的DeDiMs之间的强相关性使我们能够根据预期的MixMatch准确度,预先定量地对不同的无标签数据集进行排序。这就是我们所说的MixMOOD。此外,我们认为MixMOOD方法有助于标准化在涉及分布外数据的真实世界场景下对不同半监督学习技术的评估。
引用
@article{arxiv.2006.07767,
title = {MixMOOD: A systematic approach to class distribution mismatch in semi-supervised learning using deep dataset dissimilarity measures},
author = {Saul Calderon-Ramirez and Luis Oala and Jordina Torrents-Barrena and Shengxiang Yang and Armaghan Moemeni and Wojciech Samek and Miguel A. Molina-Cabello},
journal= {arXiv preprint arXiv:2006.07767},
year = {2020}
}
备注
The first two authors made equal contribution