它们并非完全无用:面向类不匹配半监督学习中可迁移无标签数据的回收利用
机器学习
2022-04-13 v4 计算机视觉与模式识别
摘要
类不匹配的半监督学习(SSL)处理的问题是:有限标注数据中的关注类别仅是海量无标签数据中类别的一个子集。因此,仅由无标签数据拥有的类别可能误导分类器训练,从而阻碍各类 SSL 方法的实际落地。为解决该问题,现有方法通常将无标签数据划分为分布内(ID)数据与分布外(OOD)数据,并直接丢弃或削弱 OOD 数据以避免其不利影响。换言之,它们将 OOD 数据视为完全无用,从而完全忽略了其中所含对分类有潜在价值的信息。为弥补这一缺陷,本文提出一种“可迁移 OOD 数据回收”(TOOR)方法,恰当利用 ID 数据以及“可回收”的 OOD 数据来丰富信息以进行类不匹配 SSL。具体而言,TOOR 首先将所有无标签数据归为 ID 数据或 OOD 数据,其中 ID 数据直接用于训练。然后我们将与 ID 数据及标注数据关系密切的 OOD 数据视为可回收,并采用对抗域适应将其投影到 ID 数据与标注数据的空间中。换言之,OOD 数据的可回收性由其可迁移性评估,且可回收 OOD 数据被迁移以使其与已知关注类别的分布兼容。因此,我们的 TOOR 方法比现有方法从无标签数据中提取了更多信息,从而在典型基准数据集上的实验所证实,取得了改进的性能。
引用
@article{arxiv.2011.13529,
title = {They are Not Completely Useless: Towards Recycling Transferable Unlabeled Data for Class-Mismatched Semi-Supervised Learning},
author = {Zhuo Huang and Ying Tai and Chengjie Wang and Jian Yang and Chen Gong},
journal= {arXiv preprint arXiv:2011.13529},
year = {2022}
}