表象之外:非独立同分布数据下的半监督学习
机器学习
2021-04-27 v1 计算机视觉与模式识别
机器学习
摘要
半监督深度学习(SSDL)中的一种常见启发式方法是基于与标记数据的语义相似性概念来选择未标记数据。例如,数字标记图像应与数字未标记图像配对,而不是与汽车未标记图像配对。我们将这种做法称为语义数据集匹配。在本工作中,我们展示了语义数据集匹配的局限性。我们表明,它有时甚至会 degrade(降低)最先进 SSDL 算法的性能。我们提出并提供了一个名为 non-IID-SSDL 的综合仿真沙盒,用于在标记与未标记数据集之间不同程度分布失配下对 SSDL 算法进行压力测试。此外,我们证明,在通用分类器特征空间中基于密度的不相似度量,在 SSDL 训练前选择未标记数据时,提供了一种有前景且更可靠的定量匹配准则。
引用
@article{arxiv.2104.10223,
title = {More Than Meets The Eye: Semi-supervised Learning Under Non-IID Data},
author = {Saul Calderon-Ramirez and Luis Oala},
journal= {arXiv preprint arXiv:2104.10223},
year = {2021}
}
备注
Presented as a RobustML workshop paper at ICLR 2021. Both authors contributed equally. This article extends arXiv:2006.07767